头条推荐
A | 2026年,数学遭遇密集"AI攻城"。 新智元报道 上海世博展览馆,WAIC 2026,H1-A530展位前围了三层人。 7月20日,Anthoropic的一名员工Levent Alpöge在X.com上说,自己在看世界杯时,顺手用Fable 5找出了雅可比猜想的一个反例,在X上引起轩然大波,因为这是数学界的顶级“悬案”之一,人们用了87年试图证明它的正确性;华人数学家张益唐当年的博士论文题目正是与此有关,而论文的不顺又导致他后来多年以打杂为生。 最抓眼球的是入口处的「零售区」。 Anthropic这个非正式的数学高光时刻,已经比对手晚得多。再往前推两个月,OpenAI和谷歌几乎是当面对决。 5月20日,OpenAI 宣布:其内部一个通用推理模型,自主推翻了匈牙利传奇数学家保罗·埃尔德什(Paul Erdős)提出的"单位距离猜想"。一个观众随手在点餐台下了单。几秒钟后,机器人「听到」了指令,头顶的「眼睛」一扫,灵巧手伸进塞满饮料的货架层里,精准抽出目标瓶子,转身送到前台。

B | 工业区更热闹:两台人形机器人在「搭班干活」——一台搬运料筐,另一台从筐里抓取工件精准放到指定位置。这个问题已困扰了数学家整整80年。菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)直言不讳地评价:“此前没有任何AI生成的证明能接近这个水准。” 仅仅一天后,Google的DeepMind 以更大的规模还击。 他们设计的数学模型AlphaProof Nexus,自主解决了9道公开的Erdős难题,其中2道已经悬而未决长达56年。 旁边展示直接挑战了机器视觉领域公认的「老大难」——透明物体识别。此外,它还解决了另外一些问题,每个问题的推理成本也低到仅为几百美元。透明瓶子、塑料袋包装、反光饮料罐混在一起,对传统相机来说几乎是「隐形」的,但这台机器人看它们跟看积木似的,抓得又快又稳。 这是2026年7月的上海,WAIC开到第九年。

C | DeepMind高管Pushmeet Kohli宣布AlphaProof Nexus解决了数个问题丨X.com 三家公司的成果,在数学界和大众舆论中都引起了轰动。 能力飞跃 要理解今年数学界的震撼程度,可以回看这条清晰的加速曲线。 2024年7月,DeepMind的AlphaProof在国际数学奥林匹克竞赛(IMO)中解出6道题中的3道非几何题,达到银牌水平。今年具身智能第一次与智算并列为两大核心赛道,超过200家具身智能企业到场,人形机器人几乎挤满了整个展馆。

D | 这是AI首次在IMO中获得奖牌级表现。 但在这片热闹里,有一家公司做的事有点「反常」——它不造机器人。 回过头看刚才的画面:货架取货的是人形机器人,高速抓取的是工业机械臂,线束装配的又是另一种形态。 形态不同,任务不同,物体更是千差万别——布偶、螺母、透明瓶子、柔性线束。 但它们表现出来的能力却是相似的:都看得清环境,都理解任务,都能规划动作、精准执行。

E | 为什么?答案不是梅卡曼德造出了一台「万能机器人」,而是:它造机器人的「眼睛」「大脑」和「手」,然后把这一套装进不同的身体里。就像安卓不造手机,但可以让所有手机都能跑同一套系统。注意,此时它解出的问题都有答案,不是未知、开放性的。 2025年10月,OpenAI曾声称GPT-5解决了10道Erdős难题,但这一说法在几小时内就被公开驳斥:GPT-5并非原创求解,而是做了"超级文献检索",找到了此前罕为人知的已发表论文。

F | 2025年年末,DeepMind部署了智能体Aletheia。 智能大于形态 机器人不会只有一种身体 全行业都在问:具身智能的终极形态是什么?很多人回答「人形机器人」。在Erdős问题数据库中,Aletheia挑选了700道进行尝试;它正确解决了13个问题,其中4道是新解答,另外9道又是“超级文献检索”成功了。但这个逻辑有问题。 而2026年5月至今的这三次突破,有了本质性不同: 第一,问题份量重。 工厂要的是快准稳的机械臂,人形反而笨重;仓库要的是能满场跑的轮式机器人,两条腿不如轮子效率高;便利店要在货架间穿梭的服务机器人,全尺寸人形连转身都费劲;家庭场景更不用说——橱柜下面那点空间,你让一米七的机器人蹲下去够东西? 不同环境天然需要不同的身体,用一种形态解决所有问题,就像用一把螺丝刀拆所有电器——理论上也许行,实际上一定不行。Aletheia的研究者自己就承认,去年所解决的4道 Erdős 难题,大多冷门,有些可能从来没有专家认真尝试过。但此次OpenAI 所推翻的“单位距离猜想”,核心、知名,哪怕有Erdős本人为它悬赏却仍长期悬而未决,难度和地位都得到公认。 Anthoropic Fable 5找出反例的雅可比猜想,被美国数学家、菲尔兹奖得主斯蒂芬·斯梅尔(Steve Smale)列入“18个21世纪的世纪数学难题”。虽然这次AI只是找到了三维空间中的一个反例、二维中猜想是否为真尚不得而知,但仍因问题难度大,而被许多数学家认为是AI的重要突破。 第二,更自主。 梅卡曼德创始人邵天兰在达沃斯世界经济论坛上说过:物理AI不指向某一种具体形态,而是一套通用能力。

G | 真正决定机器人有没有产业价值的,不是它像不像人,而是能不能快速适应复杂环境、完成真实任务、用足够低的成本实现部署。之前AI解决数学问题是"半自主"的:AI生成候选方案,然后需要数学家人工筛选、修正细微错误。而OpenAI 5月的突破,是模型完全自主地生成了整个证明。 所以梅卡曼德的策略是「一脑多形」:同一套「眼脑手」,装进人形机器人、双臂轮式机器人、半身人形机器人、工业机械臂都行。 身体百花齐放没关系,脑子得是同一颗。 这颗「大脑」到底长什么样 Mech-GPT多模态大模型是整套系统的核心,不只是个听懂人话的聊天模型。 给它一句「把货架第二层左边那个蓝瓶子拿过来」,它得先弄清你要哪个瓶子,再用「眼睛」看清现场,然后把这句话拆成一串动作:移到架前、伸手、抓稳、退出、送到前台。更进一步地,谷歌的AlphaProof Nexus不再需要数学家给它做质检了。它利用了一种叫Lean的形式语言,自主完成了正确性检验。

H | Fable 5的工作细节,现在我们还不得而知。

I | 轰动新闻,离不开精心“设计” OpenAI所解决的那个问题是这样的:在一个平面上放 n 个点,那么距离恰好是1的点,最多能有多少对?数学家Erdős在1946年猜测,正方形网格的排列方式是最优解。 不管你会不会解这道问题,但我相信,你很容易看懂它。 难的是现场随时在变。这也正是OpenAI新闻成功引发轰动的关键点之一。瓶子被碰歪、位置偏了、冒出新障碍,大脑就得当场改计划。 所以这颗「脑」至少干四件事:理解任务、感知环境、规划行动、监督完成——把「想做什么」「现场什么样」「下一步怎么走」「做完没有」串成一条闭环。 “OpenAI的数学团队里,有很了解数学研究的专业人士。

J | 这就是物理智能和文本智能最大的不同:答题,打完字就结束;干活,只有瓶子真拿到、工件真放准、插头真插进,才算完成。

K | 比如,现场Mech-GPT多模态大模型的人机交互单元演示。这个团队显然是花了大量的时间,从那些尚未被解答的数学问题中,挑选哪个可能做得出来。

L | 观众走到屏幕前,用自然语言跟机器人「聊天」——你可以随口说「把积木按顺序排好」,它听得懂、想得明白、做得到。从被挑选过的问题中,又着重精选几个最有可能出成果的、简单到大众也能听懂、数学家又要足够关注的问题”,北京大学国际数学中心副教授李欣意这样分析。

M | “甚至他们要考虑到,证明也不能冗长,不能让数学家用上半年才能复核完毕。不是固定的语音指令识别,而是真正理解你在说什么、你想干什么。 播放 下一个 打开循环播放 00:00 / 00:00 倍速 3.0X 2.0X 1.5X 1.25X 1.0X 0.75X 0.5X 多音轨 AirPlay 0 静音播放中,点击 恢复音量 画中画 网页全屏 全屏 你可以 刷新 试试 视频信息 1.33.6 播放信息 上传日志 调试信息 [X] 视频ID VID - 播放流水 Flowid - 播放内核 Kernel - 显示器信息 Res - 帧数 - 缓冲健康度 - 网络活动 net - 视频分辨率 - 编码 Codec - mystery mystery - 按住画面移动小窗 再说「手」。光知道该做什么还不够,还得做到。” Anthoropic Fable 5所提出的雅可比猜想反例,更是简洁到只有寥寥几行式子,很容易就被其他数学研究者验证。

N | 世界动作模型配合新一代Mech-Hand灵巧手,把高层指令翻译成抓、捻、拿、握、敲、插接等精细动作。

o | WAIC现场亚毫米级线束装配,就是「手」的极致体现。 最后说「眼」。高精度3D视觉加上透明物体成像算法,让机器人在复杂光线、杂乱料框、狭窄货架中精准识别物体的位置、形状和材质。 传统算法面前一个玻璃杯和「什么都没有」差不多,但梅卡曼德的算法能把透明瓶子看得清清楚楚。 一句话:眼睛看清世界,大脑理解任务,手把想法变成动作。三者合在一起,不是某台机器人的专属技能包,而是一套通用智能底座。 通用性和泛化性不是口号,要靠难题来证明 「通用」和「泛化」在AI行业快被说烂了。

p | Levent最初的那条推文丨x.com 是的,研究者们必须把“人类友好”考虑进去。 AI现在还不能抛开人类 当AI使用大语言模型写出一些“看起来很有道理”的推理的时候,它到底有没有犯错,是很难由它自己来确证的。梅卡曼德在WAIC上的回答是:你说「通用」和「泛化」,我用场景验证。 跨形态——同一套智能进入人形机器人、双臂轮式机器人、工业机械臂,形态不同,都能干活。 跨物体——不只认识规则工业零件,还认识几百种日化、食品、玩具、文具,连透明的、柔软的、反光的都能识别。 在WAIC现场的分拣单元,面前堆了几百种乱七八糟的物体——日化用品、文具、水果、蔬菜、玩具、零食——十几种类别,机器人一件件拿起来,扫一眼,准确丢进对应的分类框。 跨环境——深筐、货架、流水线、狭窄空间都能应对。 跨任务——搬运、分拣、装配、取货、协同作业,不需要每换任务就从头开发。

q | 但更关键的是硬指标。

r | 工业客户不关心动作帅不帅,就看核心指标:速度、成功率、精度等。 OpenAI使用的是一个通用推理模型。高速抓取单件小于2.4秒,线束装配亚毫米级,双机协同全程无人干预——这说明梅卡曼德展示的不是实验室Demo,而是接近真实生产要求的系统。它接收到问题后,用自然语言(即人类能读懂的语言)生成了一条非常长的思维链,每个子Agent做一部分短小的自然语言论证、一环套一环,最后得出一个结果。 比如,现场中一只机械臂在杂乱料框里高速翻找,每抓一个五角螺母不到2.4秒。你还没看清怎么定位的,零件已经稳稳落在传送带上。 真正的护城河:从1套到27000套 具身智能有一个残酷真相:让机器人成功表演一次不难,难的是换工厂、换国家、换物体后,还能快速上线稳定运行。难的不是Demo,是部署。 但自然语言推理有一个天然的弱点:模型可能在推理链的某一步犯小错,最终酿成大错。 邵天兰说过一句很实在的话:问题不在硬件。所以OpenAI请来了9位顶级数学家对证明进行人工审查。速度、精度、负载、成本,今天的机器人都够用了。真正限制规模化的,是部署难度。 真实工业环境里,一套系统要稳定跑起来,往往得机械、电气、方案、软件、AI一大帮工程师折腾几周甚至几个月。这种「手工作坊」式交付没法复制,成本摊不下来,最终「算不过账」。

s | 梅卡曼德的解法是用标准化「眼脑手」组件,打通「感知—决策—规划—执行—数据反馈」的完整闭环,尽量减少人工调试。

t | 这些数学家不仅验证了正确性,还大幅改进了原始证明,使之更简洁、更通用。 而部署量够大后,一个更强的机制开始启动——数据飞轮。机器人在汽车、物流、锂电、3C、家电的真实产线上,每天都在遇到新物体、新光线、新任务: 大规模应用产生真实数据→数据提升模型泛化性→模型降低部署难度→更快进入更多行业。 飞轮一旦转起来,后来者追赶的难度是几何级增长的——你追的是一个越跑越快的对手。 而这套能力的规模,早已不只在国内。

u | 截至目前,梅卡曼德全球累计部署超过27000套产品。Erdős问题数据库的维护者托马斯·布鲁姆评论道:"人类在讨论、消化、改进这个证明以及探索其后果方面,仍然扮演着关键角色。" DeepMind的AlphaProof Nexus在推理过程中,靠Lean语言暂时摆脱了“人”证明它对不对;人类只最后确认结果的数学意义。 能在完全不同的工厂标准、机器人品牌、集成商体系里都稳定落地,靠的不是把货卖出去,而是十年、27000套一个个磨出来的兼容性。

v | · 大语言模型会用 Lean 的形式化语言生成证明步骤; · Lean编译器检查每一步是否成立;如果某一步不通过,Lean 返回错误信息,模型据此修正; · 循环往复,直到成功。 全部用Lean去验证这件事情,看起来很美妙,但还远远没有到完全能够实操的程度。 27000套,不是27000次演示——每一套都在真实产线上跑着。简单说就是:Lean语言严格而冗长,人类很难直接写或读懂,需要“翻译”,但“翻译现有数学定理”这一基础建设,也还差得很远。

w | AI的数学能力高于人类吗? 先说结论:AI目前并不比人类更聪明。 全球化不是卖货 是一种综合能力 「全球化」不只是把产品卖到海外。它只是没有学科壁垒、没有权威偏见,然后“大力出奇迹”。

x | AI证明了Erdős是错的、雅可比猜想有反例,而不是像大多数人那样,面对传奇数学家的一个古早猜想,沿着心理惯性,试图证明他是对的。

y | 它又比那些试图寻找反例的人,更有耐心反复尝试。真正难的是:能不能适应不同国家的工厂标准?兼容当地主流机器人品牌?跟当地集成商体系打通?提供及时的本地服务?这考验的是研发、标准化、交付和服务的综合能力。 梅卡曼德覆盖近50个国家和地区,服务100多家《财富》世界500强客户,国内细分领域连续6年市占率第一。 AI是个“通才”,这同样令人类自叹弗如。

z | 它在美、日、韩、德都设有团队,能适配市面上几十个品牌、上千个型号的机器人,欧美日韩主流市场市占率领先。 这是用十年时间、27000套部署一个个磨出来的兼容性。5月份OpenAI解决的单位距离问题属于几何领域,成功的关键是,它从代数领域的数论中引入了一个看似无关的工具。 正如邵天兰所说——出海不仅仅是一项任务,更是一种能力。能在全球不同市场做到标准化交付和规模化部署,本身就是技术成熟度和产品化水平的证明。

| 要知道,现代数学高度分工,研究组合几何的数学家通常不会深入探究数论,反之亦然。这两个领域之间的距离,就像让一个心脏外科医生去想到用免疫学的方法治病。 不过,AI现在缺乏在新方向上的洞察和探索能力。 物理AI不是一场表演赛,而是一场部署能力、数据积累和产品标准化的马拉松。在这条跑道上,27000套已经跑完的路程,就是最好的简历。李欣意做了一个这样的比喻: “如果人类的数学知识可以比喻成一个有凹有凸的多边形,外部是未知部分,那么一流的数学家可能在一个尖角上把边界拓展到远处;像希尔伯特这样的伟大数学家,甚至在好几个方向都走得很远;而广大的数学工作者大多数时候做的事情,是把凹进去的部分补齐——数学上叫做‘取凸包’。 编辑:大卫 所罗门。” “现阶段‘大新闻’里的数学AI,也不过是把知识变成知识的凸包,而不是在未知方向上探索得更远。” 黄色的部分,是AI的“补齐”短板 假如有朝一日, AI 掌握了往外走的能力,那可能确实就真的是全面超越了人类。 数学家预见到重重危机 2026年6月2日,来自15所大学的16位研究者发布了《莱顿人工智能与数学宣言》。这份宣言获得了国际数学联盟(IMU)的正式支持,陶哲轩、彼得·舒尔茨等知名数学家也公开签署。 宣言并不反对使用AI,也鼓励数学家了解新兴技术。

| 它担心的是,在用AI更快、更多地生成成果的过程中,数学界一些基本价值观可能被破坏。

| 最直接的问题是,AI能够快速生成大量“看起来正确”的证明,其中却可能藏着很难发现的错误。

| AI“完成”一个证明只需要几小时;认真审查它,却要花几周甚至更长。有能力审稿的数学家极其有限,AI成果井喷会导致同行评议体系“消化不良”;如果大量的AI推理直接以预印本甚至新闻稿的形式发表,则是严重的误导,并挤占了那些真正有价值的发现的空间。 这个担忧甚至马上被验证了。就在几天以前,OpenAI在发布GPT 5.6 Sol的关头,发布新闻稿,宣布解决了一个尘封50年的数学问题。但这个成果并没有得到外部数学专家的确认。 OpenAI也没有说明,在“智能体解答问题”和“最终产出3页结果”之间,还有多少人类劳动丨OpenAI 另一个问题是成果归属。数学AI建立在大量的前人研究成果之上,但在输出时,往往无法为贡献者合理署名,这对数学家不公平。

| 部分训练数据还涉及未经许可使用论文和数据库,由此产生新的版权争议。

| 以及,如果数学家协同AI产生新的数学,那么这一成果究竟是属于人类还是AI? 《宣言》还提出了一个更隐蔽的威胁:科技公司可能开始影响数学界的导向。AI公司倾向于搞那些“容易做”的问题,而非“有深远意义”。在大学预算紧张的背景下,这可能改变激励机制,变相鼓励研究人员与科技公司进行不对等的合作。如果不加以控制,可能破坏现有的招聘、资助和认可机制,威胁研究人员的自主性,甚至影响数学研究本身的范围和深度。 作者:Luna 题图:Sally Caulwell。
Current article:http://kt13.shangyaohujunwei.bond/news/20260826_272.html
Published on:11:20:57