【网通社快报】小鹏发布X-Mind技术框架,构建车端主动思考能力
汽车
汽车 > 汽车资讯 > 正文

【网通社快报】小鹏发布X-Mind技术框架,构建车端主动思考能力

在CVPR2026具身智能基座模型部署研讨会上,小鹏集团通用智能中心负责人刘先明提出了优秀世界模型应具备的三大核心能力:主动思考、可控生成和长时序推演,并正式推出X-Mind技术框架。该框架旨在解决自动驾驶系统在车端算力受限条件下认知推理与实时计算之间的矛盾。X-Mind通过显式的时空推演,在模型输出动作前实现实例化的视觉思维链,赋予系统类似经验驾驶员的前瞻性判断能力。其技术实现包含三个层面:首先,构建“思维草图”,利用深度压缩自编码器将未来12帧的世界状态压缩为96个Token,以BEV布局和抽象驾驶先验保留道路拓扑、交通灯状态及导航意图等关键语义信息;其次,采用递归块扩散机制,在大语言模型内部不同层级内化未来推演过程,单次前向传播即可完成高质量预测,图像生成质量(FID9.59)显著优于单步去噪方法(FID67.30),且推理延迟基本持平;第三,实现思维链可视化,直观呈现模型对障碍物占位与车道连通性的推演过程,支持算法验证与用户信任建立。与此前发布的侧重未来画面预测的X-Foresight不同,X-Mind聚焦于为VLA模型提供“思考画布”,强调行动前的类人高效思考过程。二者协同作用,使小鹏VLA模型具备物理常识与可解释推理能力。基于数亿帧真实驾驶数据训练,X-Mind在横向与纵向轨迹预测误差上均明显优于传统VLA模型,尤其在长尾场景中安全性和合规性提升显著。其低推理延迟特性也表明该技术具备在车规级芯片上量产落地的可行性。小鹏表示,X-Mind与X-World、X-Foresight共同构成其物理AI基座模型研发谱系,初步完成车端主动思考能力的技术拼图,后续将持续探索规模法则上限,并推动相关能力向更广泛的具身智能场景拓展。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载