【网通社快报】小鹏汽车发布TuringViT视觉编码器,重构视觉大模型训练范式
汽车
汽车 > 汽车资讯 > 正文

【网通社快报】小鹏汽车发布TuringViT视觉编码器,重构视觉大模型训练范式

小鹏汽车近日发布TuringViT高效视觉编码器,面向智能驾驶、智能座舱及IRON人形机器人三大业务场景,对视觉大模型的架构设计、数据范式与训练流程进行系统性重构。当前行业普遍采用开源通用ViT方案,在高分辨率、多视角和连续视频帧等真实场景下面临算力成本高、数据效率低和场景适配难的问题。TuringViT从架构、数据和训练三个维度提出解决方案。在架构方面,TuringViT以Turing线性注意力为核心计算单元,构建混合TuringBlock架构,将全局上下文聚合的计算复杂度由二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量为Seed1.5-ViT的3.04倍。该系统提供18L和24L两个版本。在数据方面,TuringViT采用VISTA-Curation多模态数据治理流水线,通过多阶段筛选与标注优化图文和视频数据,提升单样本监督价值。其训练仅使用0.85B图文对,约为SigLIP2-L训练数据规模的10%,在ImageNet-1K等六项零样本分类基准上平均准确率达83.6%。在训练方面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA模型的输入特性,并结合二维旋转位置编码,支持不同尺寸与长宽比的输入。应用层面,TuringViT将作为小鹏第二代VLA模型的核心视觉编码器,处理多路环视摄像头输入;在智能座舱中支撑视觉与语言模型对齐;同时为IRON人形机器人提供物体识别与空间关系理解等基础感知能力。该系统不依赖特定硬件平台,旨在为行业提供可复现的视觉大模型训练路径。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载