国产黑马本地大模型StartLux
中国信通院人工智能研究所近日公布的检验报告显示,上海原点星辉科学技术有限公司(StartLux)研发的本地大模型 StartLux-V1.0-27B-Preview 在可信AI大模型基准测试(MCP专项测试)中表现亮眼。该模型以27B 的参数量取得了综合性能排名第二的成绩,超越了第三名的 DeepSeek-V4-Flash,其能力范围正式跨入 DeepSeek-V4-Pro 所代表的万亿参数模型能力区间。
此次 MCP专项测试共涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计等6类专项任务及综合评估,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等维度的综合表现。测试结果显示,StartLux-V1.0-27B-Preview 综合得分为39.25,不仅超越了284B 的 DeepSeek-V4-Flash-0731和198B 的 Step-3.7-Flash,在同等参数规模下也比 Qwen-3.6-27B 高出5.34个百分点。在单项任务中,该模型在位置导航上斩获第一,在浏览器自动化与金融分析等任务中则与1.6T 参数的 DeepSeek-V4-Pro 并列第一或独占鳌头。
这一突破源于技术路径的创新。StartLux 以 Qwen3.6-27B 为基座进行后训练定向增强,团队自主设计了全新、多维度、可验证、可规模化的模型优化升级技术。在训练过程中,团队采用 AI 训练 AI(Auto Research)方法自主开展训练实验,并通过反馈持续持续优化策略,使其成为国内首个采用该方法进行后训练的本地 Agent 模型。
这一进展折射出行业的深刻转向:当基础模型能力跨过实用门槛,过去两年以参数规模为核心的军备竞赛已进入同质化阶段。相比跑分,企业和用户更关注实际问题解决能力、数据安全与可控成本,而这些需求正加速推动本地大模型走向前台。当前,Google、meta、英伟达等全球科技巨头均在加速布局30B 级别的本地模型,行业普遍预测本地大模型将在未来几年内占据重要市场份额。
目前,StartLux-V1.0-27B-Preview 已经能够在消费级个人电脑上运行。据悉,该公司计划于年内推出第一代本地智能解决方案,同时团队也在稳步推进后续训练,并对扩散式语言模型等新架构展开深入研究与优化。
