StartLux
中国工信部信息通信研究院人工智能研究所发布的最新检验报告显示,上海原点星辉科学技术有限公司研发的本地大模型StartLux-V1.0-27B-Preview在可信AI大模型基准测试MCP专项测试中表现优异,以27B参数量获得综合性能第二名,超越了参数量更大的DeepSeek-V4-Flash和Step-3.7-Flash等模型,其能力范围已接近万亿参数的DeepSeek-V4-Pro水平。
MCP专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理和3D设计六大类专项任务及综合评估,共设置七项检验项目。该测试重点考察大模型在多工具协同、复杂任务执行和真实环境交互等方面的综合能力,部分指标参考了开源项目MCP-Universe。参与测试的模型包括DeepSeek-V4-Pro(1.6T参数)、DeepSeek-V4-Flash-0731(284B参数)、Step-3.7-Flash(198B参数)、StartLux-V1.0-27B-Preview(27B参数)、Qwen-3.6-27B(27B参数)和AgentCPM-Explore(4B参数)。
测试结果显示,StartLux-V1.0-27B-Preview综合得分39.25,位列第二,不仅超越了参数量更大的DeepSeek-V4-Flash-0731和Step-3.7-Flash,在同等参数量级下,较Qwen-3.6-27B高出5.34个百分点。在单项任务中,该模型表现更为突出:位置导航任务排名第一,浏览器自动化和金融分析任务与DeepSeek-V4-Pro并列第一或独占鳌头。
StartLux团队以Qwen3.6-27B为基座,通过后训练定向增强技术,将27B参数的本地模型性能提升至与1.6T参数旗舰模型相当的水平。这一突破得益于团队自主研发的全新、多维度、可验证且可规模化的模型优化升级技术。在训练过程中,团队采用AI训练AI(Auto Research)方法,自主设计训练实验并通过反馈持续优化策略,这一方法代表了全球模型研发的前沿方向。据悉,StartLux-V1.0-27B-Preview是国内首个采用该方法进行后训练的本地Agent模型。
这一成果反映了行业发展的显著转向:当基础模型能力跨越实用门槛后,过去两年以参数规模为核心的竞争已进入同质化阶段。同等规模模型在基准测试中的差距逐渐缩小,而用户和企业更关注模型解决实际问题的能力、数据安全性以及成本可控性。这些需求推动行业将目光转向本地化方案——数据不出域、推理在本地、能力可定制成为新的发展方向。
全球范围内,本地模型正获得越来越多关注。今年4月,Google推出Gemma 4系列,其中31B Dense版本在开源模型排行榜中位列第三,量化后可在消费级显卡上运行;8月初,meta发布30B参数的本地模型Muse Glimmer并开源;同月,英伟达推出开源模型Nemotron 3.5 Lightning,这是一款30B参数的MoE模型,可直接在RTX PC等本地设备上运行。行业专家预测,本地模型将占据更大市场份额,盛大网络创始人陈大年认为三年内本地模型将占据80%的大模型市场,Multiverse Computing联合创始人Roman Orús也表示本地大语言模型将成为云端服务的有力竞争者。
目前,StartLux-V1.0-27B-Preview已实现在消费级个人电脑上运行。公司计划年内推出第一代本地智能解决方案,同时团队正持续推进模型训练,并对扩散式语言模型等新架构进行深入研究与优化。
