首页 > 最新小说 > 秘密花园

拳王

OpenAI 将崩溃调试视为流行病学研究,修复了存在 18 年之久的 GNU libunwind 漏洞_我的网站

小产权房

A |     今年WAIC(世界人工智能大会)期间,许多人都在谈论世界模型,但说的未必是同一件事。    作者 | Steef-Jan Wiggers     译者 | 平川          OpenAI 的工程师们花了数周时间,试图解释 Rockset 中那些神秘的崩溃问题。Rockset 是一款 C++ 数据基础设施服务,为 ChatGPT 的搜索和数据插件提供支持。         7月19日,在上海西岸国际会展中心,同一场论坛上,两种不同的声音先后登台。中国科学院院士、南京大学副校长周志华讲述了决策层世界模型依然面临的现实:推演误差和交互试错的高昂成本。函数似乎会返回错误的内存地址,栈指针在执行过程中似乎会偏移 8 个字节。他的团队最近有些许进展,但这仍是他口中“正在探索的方向”之一,而非已经解决的问题。         昆仑万维董事长兼CEO(首席执行官)方汉则给出一种判断。“2026年是‘世界模型元年’。团队提出的每一种假设都面临着有力的反证。AI不再只停留在生成内容,而是开始理解世界怎么运行,预判行动会带来什么结果。”          一个“探索中”,一个“元年”。这个 Bug 似乎根本不可能存在。产业已经在抢跑,但世界模型的地基还没打完。         他们原本以为是一个 Bug ,结果却发现是两个互不相关的 Bug ,它们只是很巧合地在同一时间被发现了。这一突破性发现并非来自对单个崩溃事件的深入排查,而是源于转向了他们所说的“流行病学调试”:构建一条管道,自动分析过去一年中生产环境的每一个核心转储文件,然后寻找整体规律,而不是对单个案例进行推断。         该团队让 ChatGPT 编写了一个脚本,用于下载每个核心文件的开头部分,提取寄存器数据,过滤已知的误报,并将每次崩溃标记为“返回空指针”、“栈对齐错误”或其他类型。

B |          同一个世界模型,公司各自“解题”          每家公司对世界模型的界定,几乎都精准卡在自己正在做的事情上。         腾讯不做硬件本体,只承担具身大脑平台的角色。他们将该脚本并行应用于过去一年中的所有 Rockset 核心转储文件。腾讯首席科学家、Robotics X实验室主任、福田实验室主任张正友认为,机器人行业就像iOS与安卓、Mac与Windows,也会分化出“全栈自研”和“平台+生态”两条路,腾讯选的是后者。

C |          在模型上,他认为VLA(视觉语言动作模型)短板明确,没有预测能力,而世界模型可以基于行动后果做预测。

D | 他们很快就发现了相关性。原本从症状上看属于同类的问题,实际上对应两组特征完全不同的崩溃事件。世界模型下一个有价值的方向,在于模型同时传递语言和图像信息,能推理,也具备想象力。

E |          这些因栈对齐错误导致的崩溃均源自同一个 Azure 区域,有明确的起始日期,而且从未出现在长期运行的节点上。团队追踪发现,这些崩溃源自一台物理主机,其 CPU 正在悄无声息地产生错误的结果。它既没有过热,也没有抛出机器检查异常,而只是数学运算默默出了错。         智象未来创始人兼CEO梅涛认为,一个真正的世界模型有三个要素:表达、推演、构造世界。实现这些的关键在于,让模型真正建立起对物理世界统一的认知。将该主机从服务中移除后,因栈对齐错误导致的崩溃便完全消失了。

F | 这也就是智象未来坚持原生全模态大模型的初衷:不是做一个更大的拼接模型,而是在最底层把“世界的运行规律”刻进模型的DNA里,以统一的方式理解视觉、语言、动作和空间关系。

G |          在剔除硬件崩溃问题后,剩余的由“返回空指针”导致的崩溃问题便变得可控了。         梅涛认为,如果我们仅仅是把世界进行复现,本质上只是在做现有知识的压缩、拟合与复刻。在这样的范式下,人类五千年文明积累的信息量上限,就是AI的能力上限。         但他也坦言,现在包括视频、多模态、具身、3D在内的各种世界模型,离真正的世界模型还比较遥远。此前,团队曾排除了 C++ 异常展开的原因,因为他们认为自己找到了反例:在未使用异常的代码路径中发生了崩溃。

H | 但这些反例全都来自有硬件损坏的故障集群。         生数科技同样基于视频数据训练世界模型,强调对物理世界的理解。生数科技CEO骆怡航认为,世界模型必须同时具备感知理解、预测想象、行动三个维度:“世界模型一定要刻画整个人与世界的交互规律,同时能驱动人与数字、物理世界打交道,这个定义应该具备很强的Foundation(基础)属性。”          作为PhysX物理引擎奠基人之一的张立华,同时也是复旦大学长聘特聘教授、飞捷科思创始人、中国人工智能学会人机融合智能专委会主任,他的判断标准落在是否符合物理规律上。         他认为,现有的主流世界模型基本还是数据驱动的视觉模型,难以把物理规律准确地嵌入模型里。“虽然你看了很多图像、视频等数据,形成了一定的物理直觉的能力,但这个能力也存在限制,就像人的物理直觉一样,虽然能够在某些条件下给出相对准确的趋势判断,但并不能保证所有情况下判断的准确性和真实性。一旦剔除了这些干扰因素,剩余的所有崩溃便都是发生在异常展开过程中了。         问题发生的根本原因是 GNU libunwind 的 _Ux86_64_setcontext 函数中有一个已经存在 18 年的竞争条件。

I | 虽然你看了很多,但不等于你抓住了这些表象背后的物理机制。

J | ”          世界模型定义还存在争议,但不影响各大公司卡位。在 C++ 异常展开过程中,libunwind 会在栈上合成一个 ucontext_t 结构体,填充所需的寄存器状态,然后调用 _Ux86_64_setcontext 将控制权转移给清理处理程序。

K |          昆仑万维不再局限于视频(SkyReels)、音乐( Mureka )等AI生成内容的业务线,开始向世界模型、机器人模型等物理AI叙事框架转变。问题在于:_Ux86_64_setcontext 在从旧结构体中读取指令指针的操作尚未完成之前,就将栈指针(%rsp)更新为指向新的栈帧。一旦 %rsp 发生变化,该结构体便不再属于活动栈的一部分,也不再受内核红区的保护。如果信号恰好在 %rsp 更新与 %rip 读取之间的这一时间窗口内到达,内核就会在该结构体之上构建其信号帧,指令指针遭到破坏,函数便会跳转到 NULL 或垃圾地址。生数科技并不瞄准单一场景,而是希望做好通用能力,用同一个模型驱动不同本体去做不同的任务,半天到一天内就能适配部署。飞捷科思则发起“物理智能创新联合体”,联合32家单位,定位成国产世界模型的操作系统底座。         竞争窗口的宽度正好为一条指令。         谁能先抓住“世界模型”这顶帽子,谁就先占住了故事的入口。以现代处理器的时钟频率计算,这大约相当于 100 皮秒。在大多数程序中,这种情况根本不会被触发。一位投资人曾透露,他年初见过一家具身智能公司,能讲出非常好的应用场景,时隔三个月后便开始讲世界模型的故事,“这是很现实的问题”。OpenAI 的 Rockset 使用了 timer_create 函数,每隔几毫秒的 CPU 时间就发送一次 SIGUSR2 信号,为的是实现轻量级的按查询记账,这样产生的信号发送事件远多于传统的应用程序。正是这种高频的信号发送,将只在理论上可能发生的竞争状况转化成了实际生产环境中的崩溃。

L |          该团队将一个修复方案和一个自包含的重现示例提交到了 GNU libunwind,并通过验证证实,其他展开器(如 libgcc)不存在这个问题。

M |          模型存短板,不能完全信任          世界模型对物理世界的理解,还存在欠缺。         破壳机器人创始人许华哲提到,即便现在的模型已经能做到不错的像素级预测,也不能完全信任它。该修复方案通过重新排序指令,确保在更新 %rsp 之前先读取 %rip,从而彻底消除了这个时间窗口。         该团队对这一教训的总结值得全文引用:          最重要的步骤并非巧妙地解读汇编代码,也不是对细节的深入了解,而是构建一个高质量的数据集。“只要是模型生成出来的东西,就一定带着模型自己的特性,如果在这样的仿真器里学策略,很容易拟合到模型的特性,而不是真实世界的特性。”          要补上这个缺口,模型需要两个方向:一是让模型本身更懂物理规律,二是让模型学习的环境足够真实。

N | 如果没有这个数据集,我们就会把两种截然不同的现象混为一谈,并试图通过推理来理清这种混乱。一旦获得了准确且完整的全量数据,问题的结构便显而易见了。         前一个方向,是视频生成厂商正在做的事,押注的是底层算法架构和高质量数据实现跃升后,模型自己能把物理规律“悟”出来。         如果你的团队正在排查难以解释的生产环境崩溃问题,请检查你们是否将多个 Bug 混为一谈。

o | 那些看似与所有假设都不相符的症状,实际上可能并不矛盾;它们可能与两个不同的假设相符,而你却无意中将它们混淆了。         智象未来选择视频、全模态到世界模型这条路径,因为“互联网视频数据非常多,这些数据已经包含许多物理规律、因果关系在内”。洞察问题结构的最快途径,并非对单个案例进行更深入的分析,而是获取涵盖所有故障案例的完整、带标签的数据。         这篇完整的工程技术博文包含了详细的栈内存示意图、存在漏洞的汇编指令,以及揭示出两种不同类型故障的崩溃率可视化图表。

p | 并自研了UiT(Unified Transformer)架构,在数据端则涵盖了20万小时版权数据,覆盖超70%华语电影资源的行业多模态语料库。         生数科技则用MoT架构(可以理解为是一种稀疏、多模态Transformer架构)把理解、生成和行动整合在一起,而非“先理解、再规划、再动作”的分步路线。         https://www.infoq.com/news/2026/07/openai-libunwind-core-dumps/          声明:本文由 InfoQ 翻译,未经许可禁止转载。         模型“悟”出规律,还得放到仿真环境里训练和验证。如果仿真环境本身的物理规律不够真,模型学到的东西再像,也经不起真机上的检验。这就是飞捷科思在做的事,给模型提供可信的训练地基。         一切源于张立华团队的踩坑经历。他的复旦实验室团队,早年也用过其他商用具身仿真平台做仿真训练,“仿真的时候机器人表现得非常完美,但我们把实机都造出来后,再一验证就发现不行”。后来团队排查发现,其底层的物理引擎动量并不守恒,仿真训练了很久,但因为模拟的物理规律并不符合现实世界的物理规律,导致训练好的算法不能在真机上复现。         经历这一教训后,团队没有急于继续扩大模型训练,而是转向自研底层物理引擎和仿真训练平台,目的就是要提升物理引擎和仿真训练平台的精度和能力。进一步,他们做出了全新一代物理世界模型Fysiverse,其架构是创新的“显式物理模拟器+生成式渲染器”双驱动,让生成模型继续发挥视觉表达优势,用物理引擎补因果建模的短板。         张立华认为,现在绝大部分模型还是以端到端为主,很少体现推理能力,但一个真正通用、有泛化性的模型,未来一定要具备推理能力。“遇到物体位置突然变化这类情况,机器人应该可以像人一样及时做出判断并调整策略,而不是只靠预训练学到的反应去执行。”而这种推理能力的训练,同样需要物理真实的仿真环境来支撑。         第一人称视角数据缺失,补法却不一样          模型要学好,除了要有对的架构和环境,还需要足够多的数据。具身智能下一步,需要大量第一人称视角的操作数据,也就是以人的视角拍到的、真实操作物体时的视频。         视频生成厂商正在把自己的生成能力延伸向用于模型训练的数据供给。这背后是世界模型对高质量数据的渴求。梅涛提到,目前容易获取的数据基本已经被拿得差不多了,但真正高质量、有私域价值的数据反而越来越难拿到。         梅涛谈到智象未来与一家机器人公司的合作:对方提供人类带着夹爪操作的仿真数据,每个关节点精度大概在毫米级;智象未来反过来生成一份不带夹爪的真人第一人称实操视频,和原始数据一一对齐。“用这样的视频可以做增广,一份高精度、带夹爪的视频,能生成出上百到上千份不同背景、肤色、形态的版本,同样保持高精度。”          C端的数据采集,目前还停留在比较原始的阶段。许华哲提到,现在主要是靠58同城、猎聘这类公司,派人带着采集设备上门去拍;下一步可能是把采集设备直接寄到普通人家里,让人边带娃或边做自媒体,边采数据赚点钱。         究竟需要多少量级的数据,行业还在探索。启明创投给出一个参照:头部机器人公司的有效数据,会从2025年的“万小时级”,跃升到2027年的“百万小时级”,其中人类第一视角数据将占绝对主导。         而数据恰恰是行业难以共享的东西。许华哲提到,数据是具身智能里最核心的资产,几乎没人会真正把它开源出来,网上很多号称开源一万小时的数据集,点开可能只有五十小时。         当行业有人喊出“元年”时,学界在解理论“死结”,厂商在用同一个词争不同的定义。模型在往前跑,地基在往下打,中间还缺数据。

q | 世界模型在还没被讲清楚前,就已经被相信了。         新京报贝壳财经记者 韦英姿          编辑 王进雨          校对 穆祥桐。

Current article:http://0nxzfx.shangfochengcongshuaizhuang.buzz/news/20260826_620781.html

Published on:14:21:00