你懂的
WAIC观众更爱看超节点的背面_我的网站

A | 记者 陈月芹 7月17日至20日,在2026年世界人工智能大会(WAIC)的H2算力馆内,华为、中科曙光、沐曦股份、中兴通讯、东方算芯、燧原科技、百度昆仑芯、新华三、联想集团等企业,纷纷把自己的超节点机柜搬来展示。

B | 拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。 一套超节点的造价动辄数亿元,运输难度大。 对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。

C | 前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。

D | 端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。多家算力企业把一整排像墙一样、布满GPU(图形处理器)的黑色机柜横放在展台门口,正面和背面都敞开让观众查看,以至于入口非常狭窄,观众常常需要侧身挤入。

E | 也有企业把超节点柜贴墙摆放,仅开放展示单个计算“抽屉”。 WAIC现场呈现出了两种参观思路:举着“贵宾参观团”牌子的一批观众,常常站在超节点机柜前,听工作人员详细讲解;股民、技术极客和带着采购任务的企业人士,则不约而同地绕到机柜后方,研究光模块、线缆、散热方案、交换网板…… 超节点机柜前挤满了人(陈月芹/摄) 背面更有看头 AI算力不再只拼单张芯片,而是开始竞争超节点与整机柜方案后,市场的关注点更为具体。

F | 对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。 一位国企采购人士告诉经济观察报,去年华为在WAIC展出的Atlas 900 A3 SuperPoD(384 超节点),机柜背面是粗壮的高速铜缆,而今年亮相的新一代Atlas 950超节点,用上了800G光模块与高密度光纤,大幅减少了传统粗铜缆的使用。 另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。在数量上,超节点互联规模也从去年的384卡,直接升级至1024卡。 华为昇腾此次首次展出的业界最大规模超节点Atlas 950 SuperPoD真机,背面还专门挂出长条形的StarMatrix(华为星联系列)800G LPO光模块,观众可上手触摸。 华为超节点机柜背面的光模块和线束被围观(陈月芹/摄) 超节点机柜的正面,一般是高密度计算单元,形态上是一层层的计算“抽屉”或刀片服务器,如常见的8卡NPU/GPU模组化设计,专门负责庞大的矩阵运算与大模型训练和推理。

G | 但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。 VLA根据单帧输入难以判断任务进度而陷入循环。在WAIC现场,多数超节点产品开放了部分区域,供观众拉开“抽屉”观看。 机柜背面的重点则是高速互联、交换网板,供电与配电单元(PDU)以及光模块插槽等,主要负责连接千卡或万卡、解决带宽瓶颈。

H | 超节点不是芯片数量的堆砌。 近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。

I | 它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。 论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation 项目网站:https://steinate.github.io/cortex.github.io 论文链接:https://arxiv.org/abs/2607.05377 代码链接:https://github.com/InternRobotics/Cortex 为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。模型参数开始从千亿上升到万亿、训练集群扩张到万卡乃至十万卡量级,企业要比拼的不是单张卡能算多快,而是成千上万张卡能否算到一起。

J | 因此,关注超节点真实效率的行家,想从机柜背面看到各家打通通信瓶颈的解决方案:阿里云磐久AL128围绕AI训练和推理重构机内互联,为超节点之间预留大规模Scale-out(横向扩展)带宽;百度智能云自研XPU-Link互联协议,中兴通讯发布OEX超节点;华为强调灵衢互联,将芯片级、单板级和机柜级通信纳入统一协议。 韩国参观团了解百度昆仑芯的超节点(陈月芹/摄) 中科曙光展出的全国产十万卡AI超集群曙光8000(登峰),是“算力在沸腾”的具象化。 视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ 架构:双系统分工,精准解决 「能不能做」和「做没做完」两大核心问题 在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。

K | 这是一套采用浸没相变液冷技术的机柜,把芯片泡在特殊的“水”(电子氟化液)里,芯片工作时发热,液体吸热变成一个个气泡,把热量带走,冷却后再变回液体,循环往复。 一位中科曙光的工作人员介绍,这种电子氟化液约10万元/吨,会挥发,不够可以补加。中科曙光用了近三年时间,才找到合适的液体,完成从液体配方到整机设计的全链条自研。 其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。 中科曙光的超节点会“冒泡”(陈月芹/摄) 大模型进化,把压力给到上游 除了超节点,今年WAIC的另一个高频词是Token(词元)工厂。芯片上下游企业不能只卖卡,还需要提供Token服务。 System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。 由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。

L | 双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆 数据:统一技能范式, 让规划指令可落地、无歧义 为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。 开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。

M | 中科曙光的超节点会“冒泡”(陈月芹/摄) 一家头部国产GPU企业人士向经济观察报解释,传统GPU最早是做显卡、擅长图形处理的,如果直接拿来用在大模型上,效果不太好。如果用同一张卡既做Prefill(编码处理输入),又做Decode(解码处理输出),是不划算的。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。因此,这家头部国产GPU企业的方案是:用大算力的卡专门处理输入,用小算力但大带宽的卡专门处理输出,使同等成本下的数据处理量实现成倍增长。

N | 月之暗面是这家头部国产GPU企业的客户之一。近期KIMI K3模型爆火,不少企业在展台询问KIMI K3的降本逻辑。

o | 该头部国产GPU企业人士解释,我们是一个推理芯片的生产工厂,我不关心客户生产的是什么,我在乎的是用最小的成本,让这千张卡一天内能回答更多的问题、提供更多的服务。 大模型、Agent(智能体)能帮人类处理更多复杂任务,也对上游算力企业提出了更高的要求。 对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。

p | 围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。

q | 已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。 训练:最关键的训练样本, 集中在动作交界处 长轨迹的大多数画面都落在动作进行中。无问芯穹联合创始人兼CEO夏立雪认为,Agent推理需求上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。

r | 若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。 Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。

s | 仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。 无问芯穹的解决方案是跨集群异构PD分离架构,用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来。 这些Token工厂及下游大模型企业眼下的重点,不是“卷”生产单个Token有多便宜,而是计算把一个任务办成要花几个字、调几次、错几次,能不能更快、更高效。 企业正在加速扩产。 在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。7月19日,中科曙光相关负责人在向广东省委参观团讲解产业链落地情况时透露,中科曙光计划在广州天河区投资建设一个海光产业创新中心,将数千家生态上下游企业聚合,提供设备适配与展示平台,目前已洽谈到第二轮。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。 将成百上千张卡“算到一起”,一个超节点整机柜群功耗可能高达400KW(千瓦),单台高密度机柜的功耗在50KW以上,这对供电、散热和承重提出了严苛要求。

t | Event-balanced sampling 示意图。

u | 橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。 一家关注柜式节点的采购企业,把两个问题抛给了多家上游企业:一是整体方案能支持多少张卡,想加上更多卡时能怎么互联;二是和英伟达相比,国产GPU耗电量等后期成本有多高。他需要计算硬件成本和运维成本的总账。 实验:仿真领先几个百分点, 实机差距出现在完整任务上 Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。

v | 在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。

w | 这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。 更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。 14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。 相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。 它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。

x | 这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。 对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。 作者介绍 论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。
Current article:http://3q5q2.cesangrangshunzashuangruijiu.pics/list_m6xu0/j5vy.html
Published on:04:25:51


























