
今日,蚂蚁百灵在HuggingFace平台发布Ling-3.0-tiny模型。该模型为轻量级混合推理MoE架构,总参数量为7.9B,每Token激活1.3B参数。模型提供BF16、FP8和INT4三种权重版本,适配多平台部署需求。其采用混合线性架构,将KDA和MLA按3:1比例交替堆叠,并包含128个路由专家的稀疏MoE前馈网络。Ling-3.0-tiny支持快速响应模式和多步骤推理模式,专为本地部署设计。官方已在英伟达DGXSpark、AppleSiliconMacBook和Macmini等设备上完成验证。在M1ProMacBook上,模型推理速度达86–90Token/s;在8K上下文长度下,峰值内存占用约为8.34GiB。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”