
A | 财联社7月21日讯(记者 付静)“我们真正关注的是Token性价比:在保证模型效果和服务质量的前提下,以更低的综合成本生成更多高质量Token。”2026世界人工智能大会(WAIC)期间,云天励飞-U(688343.SH)方面在接受财联社记者采访时表示。 作者 | Steef-Jan Wiggers 译者 | 平川 OpenAI 的工程师们花了数周时间,试图解释 Rockset 中那些神秘的崩溃问题。

B | 当下,模型层面训推规模迈向万卡,应用侧C端多款智能体涌现,AI进化为生产生活“搭子”,B端的人工智能真实场景落地也在加速。Rockset 是一款 C++ 数据基础设施服务,为 ChatGPT 的搜索和数据插件提供支持。

C | 函数似乎会返回错误的内存地址,栈指针在执行过程中似乎会偏移 8 个字节。在这些需求的带动下,产业链频频传递出“算力供不应求”信号。

D | 团队提出的每一种假设都面临着有力的反证。 财联社记者多方采访获悉,算力进入“拼系统”时代,构建超节点、超集群已经成为主流做法,且收获了下游各行业的积极反应。这个 Bug 似乎根本不可能存在。

E | 他们原本以为是一个 Bug ,结果却发现是两个互不相关的 Bug ,它们只是很巧合地在同一时间被发现了。与此同时,TPU路线正在同步发力,华东地区首座国产TPU千卡智算集群已经落成。这一突破性发现并非来自对单个崩溃事件的深入排查,而是源于转向了他们所说的“流行病学调试”:构建一条管道,自动分析过去一年中生产环境的每一个核心转储文件,然后寻找整体规律,而不是对单个案例进行推断。多种方案涌现背后,产业最关心的则是Token性价比。 “超节点是未来几年重点方向” 下游已给出积极反应 WAIC期间,华为昇腾950超节点(Atlas 950 SuperPoD)真机、超节点集群Atlas 950 SuperCluster、首个全国产十万卡AI超集群曙光8000(登峰)真机、燧原科技与中兴通讯(000063.SZ)联合打造的正交架构方案“云燧ESL64-O”超节点、阿里云磐久AL128超节点服务器、沐曦股份-U(688802.SH)新一代AI超节点曦景S600、摩尔线程-U(688795.SH)MTT C256超节点、壁仞科技(06082.HK)分布式解耦架构超节点方案、百度智能云超节点“天池”等格外吸睛。 该团队让 ChatGPT 编写了一个脚本,用于下载每个核心文件的开头部分,提取寄存器数据,过滤已知的误报,并将每次崩溃标记为“返回空指针”、“栈对齐错误”或其他类型。

F | 他们将该脚本并行应用于过去一年中的所有 Rockset 核心转储文件。他们很快就发现了相关性。 华为昇腾950超节点 图片来源:财联社记者/摄 “云燧 ESL64-O”超节点 图片来源:受访者供图 中兴超节点方案 图片来源:受访者供图 中国电子云则发布了自研的翎枢6020轻量型、翎枢6032平衡型、翎枢6064性能型三款超节点产品。原本从症状上看属于同类的问题,实际上对应两组特征完全不同的崩溃事件。 中国电子信息产业集团有限公司首席科学家、中国电子云总工程师朱国平介绍,翎枢超节点将千百张GPU融合为单一逻辑超级单卡,通过Tbps级超高带宽、百纳秒级超低时延、统一内存编址提升算力释放效率。翎枢超节点覆盖20-64卡黄金算力区间,相比其他超节点方案,优势在于成本更低、生态开放,可兼容现有风冷、液冷机房。

G | 云天励飞方面也告诉财联社记者,公司未来三年计划推出DeepVerse100P、DeepVerse100D和DeepVerse100L三款芯片,分别针对Prefill、Decode Attention和Decode FFN进行优化,未来在此基础上构建面向万卡异构集群的分离式AI推理基础设施。

H | 财联社记者采访获悉,产业链下游已对超节点、超集群产品有了积极反应。中科曙光(603019.SH)方面提供的数据显示,曙光8000集群正式上线首周即需求爆满,应用满载运行,目前日均处理作业数突破15万个,单日处理作业峰值超过50万个。截至目前,曙光8000已完成近千项超智融合应用适配,覆盖大模型训练、高通量推理、科学计算等多个万卡级规模场景。 上线后快速满载,意味着科研机构、企业和开发者对超大规模、高质量算力的现实需求正在加速释放,也表明十万卡级算力已开始持续承接更加广泛的科研和产业任务。 这些因栈对齐错误导致的崩溃均源自同一个 Azure 区域,有明确的起始日期,而且从未出现在长期运行的节点上。 据悉,曙光8000采用全球首创的高密度机柜结构,单个计算单元算力密度较其他超节点提升20倍,在有限空间内实现更高算力部署;自研scaleFabric类IB原生RDMA高速互连技术,实现十万卡规模稳定互连。 另据媒体报道,华为昇腾384超节点目前已商用落地750多套,规模应用于互联网、运营商、金融、教育、医疗、交通、制造等行业。 一位算力从业者告诉财联社记者,内部连接是超节点及算力集群发展面临的核心问题。团队追踪发现,这些崩溃源自一台物理主机,其 CPU 正在悄无声息地产生错误的结果。“超节点架构、超节点内部的连接,这可能是我们现在包括未来几年重点(攻克)方向,核心是要解决GPU或TPU之间高速互联的问题,通过交换芯片提供单个节点大容量,比如可以提供64卡、128卡这种超大规模的连接,在这个基础上组建更大的千卡、万卡集群。” 据悉,在AI算力基础设施与数据中心网络架构中,Scale-Up、Scale-Out和Scale-Across分别为三种不同层次的扩展模式:Scale-Up(纵向扩展)聚焦于超节点内部的紧密耦合,Scale-Out(横向扩展)侧重于集群之间的规模扩张,Scale-Across(跨域互联)则致力于数据中心之间的广域协同,旨在打破单数据中心的物理极限。它既没有过热,也没有抛出机器检查异常,而只是数学运算默默出了错。 “Scale-Out相对来说更成熟,Scale-Up的挑战更大,这是我们要重点解决的。现在单个GPU Scale-Up领域的带宽都达到TB的级别,单交换机的交换容量可能要达到100T以上。解决了这个问题之后,才能组成大规模的集群。大规模集群要为芯片解决的,就是把极限带宽提高。将该主机从服务中移除后,因栈对齐错误导致的崩溃便完全消失了。 在剔除硬件崩溃问题后,剩余的由“返回空指针”导致的崩溃问题便变得可控了。”前述从业者介绍。 财联社记者也从中兴通讯方面获悉,针对AI大模型规模化落地的网络升级要求,其构建的智能算力网络底座,主要聚焦Scale-Out机间网络(优化单集群内部通信效率,实现稳定降本、调优增效)与Scale-Across跨域互联(实现跨数据中心、跨地域的算力资源高效调度)两大核心场景。此前,团队曾排除了 C++ 异常展开的原因,因为他们认为自己找到了反例:在未使用异常的代码路径中发生了崩溃。 TPU路线同步发力 产业最关心Token性价比 除了近几年持续热门的GPU路线,财联社记者还了解到,杭州电信、中兴通讯与中昊芯英联合打造了华东地区(杭州)首座国产TPU千卡智算集群,该集群亦是中国电信体系内首个大规模国产TPU集群部署项目。 “选择做千卡集群而不是万卡集群,是因为我们想把它做成试验田。

I | 我们先把千卡级的软件栈系统集成到千卡集群上,在Token Factory上能提供不错的服务,在服务逐步做透的情况下逐步开展二期、三期。但这些反例全都来自有硬件损坏的故障集群。

J | 未来,我们也希望逐步从千卡向万卡集群迈进,在万卡集群上运行国产模型的训练推理,而且满足所有商用需求所需要的性价比。”中昊芯英创始人、CEO杨龚轶凡告诉财联社记者。 谈及GPU与TPU两条路线如何选择,中国电信杭州分公司智算中心总经理王良表示,“并不见得每个芯片都是全能选手,不同芯片在不同场景下有独特的长处,比如TPU擅长做张量运算,我们评估推理能力是TPU的长处。” 王良还介绍,“上述TPU千卡集群落地后运行得很好,尤其是今年的Token风口起来以后,市场上对Token的需求量很大。

K | 一旦剔除了这些干扰因素,剩余的所有崩溃便都是发生在异常展开过程中了。

L | 最近(我们)和中昊芯英测试完PD分离,这一技术把TPU的优势进一步放大,已经比较满足当初的设计目标。 问题发生的根本原因是 GNU libunwind 的 _Ux86_64_setcontext 函数中有一个已经存在 18 年的竞争条件。” 据悉,该集群基于“泰则®”智算平台构建,将面向大模型训练、AI推理、科学计算等场景提供全自主算力支撑,该集群二期规划今年9月上线投产。在 C++ 异常展开过程中,libunwind 会在栈上合成一个 ucontext_t 结构体,填充所需的寄存器状态,然后调用 _Ux86_64_setcontext 将控制权转移给清理处理程序。“ 王良进一步谈到,调优将是一项非常重要的工作。

M | 他介绍,“现在所有的大模型厂商、芯片厂商,都是拿出百米冲刺的速度在跑马拉松,芯片厂商每年都会发布一个新版本,而大模型厂商每个季度都会发一个新版本,这里面的适配工作量是很大的。

N | 问题在于:_Ux86_64_setcontext 在从旧结构体中读取指令指针的操作尚未完成之前,就将栈指针(%rsp)更新为指向新的栈帧。一旦 %rsp 发生变化,该结构体便不再属于活动栈的一部分,也不再受内核红区的保护。我们在持续的调优工作中发现,从年初到现在,TPU集群通过调优实现了超过10倍的效率提升。原来每百万Token的成本如果是100元,现在就差不多能降到10元以下。

o | ” WAIC期间,多位受访的算力产业人士均谈及了Token成本问题。如果信号恰好在 %rsp 更新与 %rip 读取之间的这一时间窗口内到达,内核就会在该结构体之上构建其信号帧,指令指针遭到破坏,函数便会跳转到 NULL 或垃圾地址。

p | 对于模型厂商、AI应用企业和算力运营方而言,真正影响商业化效率的是在一定时间和成本条件下,能够稳定生成多少有效Token。 竞争窗口的宽度正好为一条指令。以现代处理器的时钟频率计算,这大约相当于 100 皮秒。在大多数程序中,这种情况根本不会被触发。

q | 财联社记者另从AI基础设施及智算云提供商九章云极方面了解到,AI从技术竞赛迈向规模交付,主要面临四个核心卡点:算力成本高企、多芯片计价割裂、GPU利用率困于30%红线、研发缺乏标准化体系。 据悉,九章智算云在全球范围内已部署12个数据中心,算力总规模约22 EFLOPS,配备6600余张GPU卡,具备日产64亿词元(Token)的生产能力。从产出量看,DeepSeek-V4是当前产出最大的模型,日产24.5亿TOKEN,占比38%,随后依次为KIMI 2.5、Qwen-3.5、GLM-5、MiniMax-2.5。OpenAI 的 Rockset 使用了 timer_create 函数,每隔几毫秒的 CPU 时间就发送一次 SIGUSR2 信号,为的是实现轻量级的按查询记账,这样产生的信号发送事件远多于传统的应用程序。正是这种高频的信号发送,将只在理论上可能发生的竞争状况转化成了实际生产环境中的崩溃。其弹性算力体系,已使得某头部模型厂商的项目综合成本最高节省了82.1%。 云天励飞方面则告诉财联社记者,降低Token成本是一项系统工程,从底层的IP、EDA、芯片设计和封装测试,到服务器、互联、软件栈和算力平台,再到模型及应用,各环节都会影响最终的Token生成效率。 该团队将一个修复方案和一个自包含的重现示例提交到了 GNU libunwind,并通过验证证实,其他展开器(如 libgcc)不存在这个问题。

r | 据了解,目前国内主流大模型的公开API价格已明显分层。该修复方案通过重新排序指令,确保在更新 %rsp 之前先读取 %rip,从而彻底消除了这个时间窗口。

s | 根据不同模型能力和服务方式,常规文本模型的输入价格大致为每百万Token几角钱至十余元,输出价格大致为每百万Token一两元至数十元。 该团队对这一教训的总结值得全文引用: 最重要的步骤并非巧妙地解读汇编代码,也不是对细节的深入了解,而是构建一个高质量的数据集。如果没有这个数据集,我们就会把两种截然不同的现象混为一谈,并试图通过推理来理清这种混乱。一旦获得了准确且完整的全量数据,问题的结构便显而易见了。

t | 如果你的团队正在排查难以解释的生产环境崩溃问题,请检查你们是否将多个 Bug 混为一谈。

u | 那些看似与所有假设都不相符的症状,实际上可能并不矛盾;它们可能与两个不同的假设相符,而你却无意中将它们混淆了。 “现在的问题不是将百万Token成本价格从2毛降到1毛,更多的是提升Token价值,这是算力基建和模型要协力解决的问题。洞察问题结构的最快途径,并非对单个案例进行更深入的分析,而是获取涵盖所有故障案例的完整、带标签的数据。如果价值的问题可以解决,定价2块或10块大家都不觉得贵。

v | ”前述算力从业者也表示。 (财联社记者 付静)。

w | 这篇完整的工程技术博文包含了详细的栈内存示意图、存在漏洞的汇编指令,以及揭示出两种不同类型故障的崩溃率可视化图表。 https://www.infoq.com/news/2026/07/openai-libunwind-core-dumps/ 声明:本文由 InfoQ 翻译,未经许可禁止转载。
Current article:http://cuozubeishenjingli.cfd/news/20260826_243185.html
Published on:09:03:57