蚂蚁百灵Ling
蚂蚁百灵大模型近日开源了一款名为Ling-3.0-tiny的轻量级混合推理MoE模型,旨在为高效本地部署提供解决方案。该模型总参数量为7.9B,推理时仅激活1.3B参数,兼顾性能与可部署性。其同步推出BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,覆盖从专业级本地AI工作站到个人电脑的不同场景。
在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分,综合表现紧追Gemma-4-26B-A4B,仅落后1分,同时超越gpt-oss-120B(high)、Qwen3.5-9B等模型。该模型采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1交替堆叠结构,并配备128个路由专家组成的稀疏MoE前馈网络。每个Token仅激活8个路由专家和1个共享专家,在长上下文建模能力、参数效率与计算成本之间实现平衡。
Ling-3.0-tiny在真实任务与Agent执行方面表现突出,Artificial Analysis Agentic Index得分达16,高于Gemma-4-31B。其GDPval-AA v2取得772 Elo,τ³-Banking得分为20.80,体现任务理解、工具调用和流程推进能力。在IMO-AnswerBench和非幻觉率指标上,该模型取得领先成绩,数学、科学推理、代码Agent、指令遵循和长上下文等任务表现均衡。输出速度方面,Ling-3.0-tiny超过160 tokens/s,生成500个Token的端到端用时约18秒,包含模型思考过程,有助于提升Agent连续执行任务的响应效率。
模型架构设计聚焦降低本地部署门槛。Ling-3.0-tiny延续Ling-3.0系列的原生混合线性注意力技术路线,采用3:1 KDA-MLA架构,每4层包含3层KDA和1层MLA,提高长上下文处理效率。MoE部分设置128个稀疏专家,每个Token激活8个路由专家和1个共享专家,以较小激活参数量承载完整模型能力。原生混合推理机制支持常规任务快速响应与复杂任务多步思考,Multi-Token Prediction训练目标为高效Token预测及推理加速提供基础。这些设计减少推理计算资源需求,降低本地部署和二次开发门槛,使轻量模型具备接入真实Agent工作流的能力。
Ling-3.0-tiny的三个精度版本覆盖不同设备需求。BF16版本适用于重视完整精度的研究评测和生产应用;FP8版本在模型效果、运行速度和资源占用间寻求平衡;INT4版本进一步压低资源需求,面向算力和内存有限的本地环境。在DGX Spark上,FP8版本单请求稳态解码速度约100至105 tokens/s,两路请求并发时聚合解码吞吐约161 tokens/s,单机可支撑小规模本地服务,潜在应用包括企业内部知识助手、研发团队代码助手等。在MacBook(Apple Silicon)上,BF16和FP8版本均可运行,FP8版本将持续生成速度提高约30%,首Token响应低于100毫秒,可承担高频本地交互任务,充当本地知识引擎。Mac mini则适合作为低功耗、常驻式本地智能节点,提供知识库检索、文档分析、自动化任务和本地模型API服务,相关任务可离线运行并提供低延迟响应。
