盖世具身智能获悉 小鹏汽车基座模型团队近日正式发布XCoT技术报告,完整披露“可执行思维链”(Executable Chain-of-Thought,XCoT)这一面向物理AI的推理范式。该技术以自动驾驶为验证场景,旨在解决物理AI本体在实时控制中面临的推理时间差问题。
传统视觉-语言-动作模型在场景理解、语义推理和动作生成环节存在时间差。
XCoT 选择缩短这条链路:模型不再花费大量 token 来描述未来,而是生成少量结构化的决策标记参与行动生成。模型生成的 XCoT 标记都储存在动作空间里,负责轨迹推理的 Control FFN 可以通过共享的多模态自注意力直接读取和执行,中间没有任何翻译工作。
图片来源:小鹏
在数据构建方面,小鹏基座模型团队构建了自动化的“推理—动作”(Reason-Action)监督数据:真实行驶轨迹提供动作证据,场景上下文提供因果语义,二者对齐后,模型便学会了在正确的场景里做出正确的决定。据报告披露,最终用于训练的混合监督数据总量达到 362 万条。
而面对下一秒发生的情况,一个物理 AI 本体可以做出不同的动作应对。XCoT 做的第一件事是收敛:将无限的可能性收束成一个明确的方向,例如减速、保持或向左。随后,Flow Matching 循着这个方向做发散,给出多条具体的做法——快一点的、缓一点的、更贴近人类习惯的,等等。
毕竟,没有第一步的收敛,发散就会变成漫无目的的枚举。
在同一个可执行标记空间之上,团队进一步提出了 XCoT 策略优化(XCoT Policy Optimization, XCPO)。其思路是:尽量保持既有动作能力稳定,重点优化模型如何作出更好的决策。
小鹏物理世界基座模型以第二代VLA与世界模型为两大支柱,可以支撑自动驾驶、Robotaxi、机器人等多个本体。面向下一阶段,小鹏指出,XCoT 可能会成为一个跨本体持续生长的接口:驾驶的决策词表覆盖车流中的博弈,机器人的决策词表覆盖抓取、避让与人机协作,而它们共享同一套推理机制。
来源:第一电动网
作者:盖世汽车
本文地址:https://www.d1ev.com/news/shichang/312653
以上内容转载自盖世汽车,目的在于传播更多信息,如有侵仅请联系admin#d1ev.com(#替换成@)删除,转载内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网,如有侵权请联系admin#d1ev.com(#替换成@)删除。