陶哲轩:几周前,AI突破数学形式化临界点
数学界的“最强大脑”,快被AI出的证明淹没了。
菲尔兹奖得主陶哲轩分享了他在IEANTN项目(显式解析数论网络集成项目)中的最新体验:
AI生成正确证明的速度太快了,但证明写得太臃肿,人类根本来不及审。
几周前还需要志愿者花数周才能认领完成的形式化任务,现在AI几小时就能搞定。
【图片1】
一个17世纪数学家帕斯 ...
陶哲轩12年前的预言,现在AI帮他兑现了
事实证明,菲尔兹奖得主有时候也兼职预言家。
12年前,陶哲轩在首届数学突破奖的台上抛出的一句预言,被视作天方夜谭:
将来有一天,我们或许不再用LaTeX撰写论文,而是使用计算机能理解的的形式化语言。
那一年,Transformer还没诞生,ChatGPT更是连影子都没有。
【图片1】
没想到,回旋镖正中靶心。过去这一年,AI在 ...
大模型本地部署最强引擎,vLLM 又发大版本了,v0.23.0
大模型本地部署,vLLM 推理优化,动手实验
离大谱,向 vLLM 提交虚假PR,给简历注水,被拉出在全世界面前示众
vLLM 是当前最流行的开源大模型推理引擎之一,从 DeepSeek 到 Llama 到 Qwen,基本上你能想到的主流模型它都支持
【图片1】
这次 v0.23.0 版本的核心主题就一句话:让更多模型跑得更快,让更多硬件用得上
【 ...
谷歌最新大模型 DiffusionGemma 续集:Unsloth 把它压到 18GB,单卡飙到 2
前几天介绍过 DiffusionGemma,当时 vLLM 在 H100 上跑出 1000+ tok/s 已经够炸裂了,结果不到三天,Unsloth 直接把它压成 GGUF,丢进 llama. cpp,单卡 2000+ tok/s 起飞——而且最低 18GB RAM 就能跑【图片1】这次有什么新东西简单说三句话:GGUF 来了:Unsloth 把 DiffusionGemma-26B-A4B-it 量化成 5 个 GGUF 版本,最 ...
OpenClaw 2026.6.5:这次更新,Anthropic/MCP 恢复功能已强化
OpenClaw 2026.6.5 发了。
官方给这版写了一句很 OpenClaw 的话:
Less chaos. More claws.
少些混乱,多些利爪。
【图片1】
这版别只看功能列表。
它真正处理的是 Agent 系统长期跑起来以后最烦的几件事:网页搜索要稳定,插件安装不能乱来,聊天渠道不能把模型内部思考甩给用户,Anthropic 和 MCP 不能因为一次缓存 ...
Hermes Agent 这个插件把我的AI日报跑通了:这次我建议你试一下
我现在越来越觉得,AI 日报真正难的不是写出来。写一份日报不难。抓几条新闻,排个列表,写几句摘要,今天就能交差。难的是明天。明天它还记不记得,我不想看那种“值得关注”?还记不记得,我要的是产品机会,不是新闻搬运?还记不记得,机会最好能落到 SaaS、SEO、自动化、低成本获客、Agent 工具链这些方向?如果这些话 ...
阿里Qwen也来卷Skill,能给LLM打分的Skill
给大模型打分,很多人第一反应是:把 rubric、参考答案、checklist、工具说明全塞进 prompt,让 Judge 自己看。
【图片1】
但 Qwen 团队这篇 Skill-RM 论文给了一个很有意思的反例:直接给 Judge 加资料,结果可能反而变差。
这篇论文最值得写,不是因为它又提出了一个 reward model,而是因为它把一个更大的问题摆到台 ...
啥?Fable 5一出,Skill和Prompt都白学了?
Workflow、Skill、SOP,可能真的要过时了。在Fable 5发布24小时后,Reddit 9年老兵Bohdanowicz连肝一天一夜,最后写下这样一句评价:“工作流的变化,比模型的变化更大。而模型的进步,是真的。”
【图片1】过去几个月,为了让模型更好用,他亲手搭了一整套工作流,把任务拆得明明白白,甚至连Harness都是自己手搓的。结果 ...
AI圈懵了:一家巴西市政IT公司开源的大模型,杀进了全球第一梯队
【图片1】
有推特博主发现,一个由巴西里约热内卢市政府旗下 IT 公司开源的模型 Rio 3.5 397B,在多项基准测试中超越了 Qwen 3.7 Plus 等开源模型,而这个模型的基础模型还是 Qwen3.5-397B-A17B。
【图片2】
另一位推特博主「Chubby」对此表示不可思议,「一个以前从来没听过的模型现在成了开源 SOTA,甚至超过了 Qwen ...
把 3 个免费模型接入到 Claude Code ,Token 随便用。
这个叫 Agnes AI 的全模态模型,从 6 月 1 号开始免费了。它把自己家的文本、图片、视频三个核心模型 API,全部免费开放。而且是无限期免费。【图片1】然后第一周,Agnes-2.0-Flash 这个文本模型,一周被调用了 1 万亿 Token。图片模型 Agnes-Image-2.1-Flash,一周生成了 200 万张 图。视频模型 Agnes-Video-2.0,一周 ...
YouTube 一哥手搓了个 AI 工作台,一周就 5 万多 Star 。
YouTube 一哥 PewDiePie 在 GitHub 上开源了一个 AI 项目。24 小时拿下 2 万 Star。这个开源项目应该是目前 GitHub 上最火的开源项目。【图片1】我看了下,现在都五六万的 Star 了。有当时 OpenClaw 小龙虾那味儿了。但用起来感觉很平平无奇,如果你是 Claude Code 或者 Codex 的重度用户。可能这个开源项目不会让你觉得很 ...
工作中的信息图,这个AI方法论都能生成
前段时间我给一家企业做 AI 落地的方案,里头一张 AI 客服系统的工作流程图、一张知识库系统的架构图绕不过去。尝试下来,我总结了一套职场上 AI 画图的方法论。我个人的经验是,不直接让它画。先在备忘录里把这张图是个啥一项项列清楚:画啥类型、里头哪几块、什么关系、什么风格、要不要插 PPT。列完再捏成一段话喂过去。 ...
仅4B大小可端侧部署!卡帕西预言的「认知模型」被国产做出来了
好家伙,卡帕西又说对了!
几个月前,这位OpenAI创始成员在访谈中抛出了一个判断:“推理模型要变天了!”
仅需10亿参数,就能构建起非常优秀的「认知核心」——一个剥离了海量事实记忆、只保留思考算法的智能单元。
结果万万没想到,如今有这样一支中国团队已经率先实践。
小冰之父李笛集结微软小冰原班人马,带着仅成 ...
大模型看Coding,具身看Picking!原力灵机已抢先入局
当具身智能行业还在密集PoC、卷demo、拼概念时,原力灵机先把答案押向了一个具体动作。
Picking。
这家公司刚刚宣布,通过股权并购方式完成与物流机器人公司Atomix的合并,将模型能力与真实场景合为一体。
与此同时,中国头部大模型公司也用真金白银表达了对这一路线的认可——智谱、阶跃星辰、商汤、阿里共同押注原力灵 ...
OpenAI芯片核心叛逃Anthropic!就在量产前夜
Anthropic到底有谁在?怎么都在往过跑啊!
刚刚,OpenAI芯片工程师Clive Chan在X上宣布离职,同时透露已于本周加入Anthropic。
【图片1】
他在推文中称赞老东家的芯片团队硬件人才密度惊人,全世界没有比这更好的芯片设计团队,但话锋一转——
我没法摆脱从山脚开始攀登新高峰的冲动。
加入Anthropic的理由,他给了三 ...
让 AI 生成的网页更有品味,这个爆火的 Skill 效果如何?
最近 GitHub Trending 上有个项目挺火的,叫 Taste Skill,专门给 AI 生成有品味的前端页面。
【图片1】
确实,用 Cursor、Claude Code 这些工具做前端页面,做出来的东西千篇一律,一眼就能看出来是 AI 生成的。
因为 LLM 是概率机器,它没有审美偏好,只会复制训练数据里最常见的模式。
之前换过不少 Skill,比如 Fro ...
腾讯开源了 Agent Memory,让 AI 真正记住你。
腾讯开源了一个项目,两个月拿了 4600+ Star。做的事非常专一:给 AI Agent 装上长期和短期记忆。装完之后什么效果?评测数据摆在这:针对长期记忆,整体准确率从 47.85% 涨到 76.10%,提升将近 60%。用户事实召回从不到 30% 飙到 79%。基于短期记忆的加持,长任务中最高节省 61% token。【图片1】这个项目叫 TencentDB Ag ...
你的 AI Agent 每次请求都在干嘛?这个开源项目帮你扒个底朝天。
每天用 Claude Code 写代码,一个月下来账单好几百刀。但你真的知道这些钱都花在哪了吗?每次请求到底发了多少 token?system prompt 里藏了什么内容?多轮对话的上下文是怎么一步步膨胀的?工具调用又消耗了多少?这些问题的答案,Agent 工具自己不会告诉你。最近逛 GitHub 发现一个叫 claude-tap 的项目,帮你偷看 AI Co ...
第一批被ChatGPT喂大的大学生,今年毕业了
最近HR圈子里流传着一个段子:简历上写精通全栈、独立完成前后端项目,结果现场改代码当场失忆,连自己提交的逻辑都讲不清楚。
大家心里都明白怎么回事——简历是AI润的,代码是AI写的,理解是没有的。
第一批被ChatGPT喂大的大学生,今年毕业了。
这届2026届,大一入学那年ChatGPT刚发布。整整四年,AI陪着写作业、做项 ...
刚刚,Claude Code 上线「Agent View」!一个
一个终端窗口,13 个 Agent 会话。
3 个正在干活。4 个在等你回复。6 个已经交付。
这不是 tmux 分屏。这是 Claude Code 原生的新功能,Agent View。
昨天正式上线,目前是研究预览状态。
【图片1】
用 Claude Code 的都知道,同时处理多个任务简直是一场灾难。
三个终端标签页还能记住谁是谁。五个以上,脑子就完全 ...