


小鹏汽车近日发布TuringViT高效视觉编码器,面向智能驾驶、智能座舱及IRON人形机器人三大业务场景,对视觉大模型的架构设计、数据范式与训练流程进行系统性重构。当前行业普遍采用开源通用ViT方案,在高分辨率、多视角和连续视频帧等真实场景下面临算力成本高、数据效率低和场景适配难的问题。TuringViT从架构、数据和训练三个维度提出解决方案。在架构方面,TuringViT以Turing线性注意力为核心计算单元,构建混合TuringBlock架构,将全局上下文聚合的计算复杂度由二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量为Seed1.5-ViT的3.04倍。该系统提供18L和24L两个版本。在数据方面,TuringViT采用VISTA-Curation多模态数据治理流水线,通过多阶段筛选与标注优化图文和视频数据,提升单样本监督价值。其训练仅使用0.85B图文对,约为SigLIP2-L训练数据规模的10%,在ImageNet-1K等六项零样本分类基准上平均准确率达83.6%。在训练方面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA模型的输入特性,并结合二维旋转位置编码,支持不同尺寸与长宽比的输入。应用层面,TuringViT将作为小鹏第二代VLA模型的核心视觉编码器,处理多路环视摄像头输入;在智能座舱中支撑视觉与语言模型对齐;同时为IRON人形机器人提供物体识别与空间关系理解等基础感知能力。该系统不依赖特定硬件平台,旨在为行业提供可复现的视觉大模型训练路径。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”