IMO满分AI新突破:从竞赛夺冠到解锁生活难题新技能
小红书近日宣布开源其自主研发的轻量级智能模型dots3-note preview,该模型与GPT-5.6、Claude Fable 5等大参数模型形成鲜明对比,以极小的参数量实现了高效的任务处理能力。这一模型属于dots3系列,其同系列模型曾在国际数学奥林匹克竞赛(IMO)中以满分42分的成绩夺得金牌,成为IMO历史上首个获得满分的AI模型,而同年人类选手的满分人数仅为7人。
dots3-note preview的参数量仅为280亿,激活参数160亿,上下文窗口为512K,属于轻量级模型。传统观点认为,智能体(Agent)的能力与模型参数量直接相关,但dots3-note preview通过创新的任务处理方式打破了这一认知。该模型采用“分步解题”的逻辑,将复杂任务拆解为多个简单子任务,逐一解决,类似于人类考试时逐题解答的方式。这种策略使其在多项推理及智能体任务中表现优异,甚至超越了参数量数倍于己的大模型,尤其在视觉能力方面表现突出。
在技术实现上,dots3-note preview的核心优势在于其自我评价机制和TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)训练方法。自我评价机制允许模型在任务执行过程中实时评估进展,而非依赖最终结果反馈,从而提供更及时的训练信号。TEMPO则通过将长轨迹任务切割为多个宏步骤(macro-step),在每个步骤结束时由同一模型切换角色进行价值评估,优化后续策略。这种方法解决了传统强化学习中信号延迟和信用分配困难的问题,使模型在长程任务中表现更稳定。
dots3-note preview的另一亮点是其对“真实生活任务”的适应性。传统AI模型擅长处理评分标准明确的数学或代码问题,但现实生活中的任务往往模糊且主观,如旅行规划或日常决策。小红书实验室通过开源VibeSearchBench和VibeLifeBench两个基准测试,为评估模型在真实场景中的表现提供了统一标准。VibeSearchBench模拟多轮搜索任务,要求模型在用户需求逐步明确的过程中提供精准结果;VibeLifeBench则测试模型在非静态环境中的跨阶段任务执行能力,覆盖出行、就医等复杂场景。
在应用层面,dots3-note preview已展现出强大的自主学习能力。例如,在未经过任何训练的《杀戮尖塔2》游戏中,该模型通过探索环境、学习规则,最终成功通关33关。这一表现验证了其通过上下文学习而非记忆完成任务的能力,与ARC-AGI 3基准测试的目标高度契合。ARC-AGI 3专注于评估AI在陌生环境中的自适应能力,dots3-note preview在该测试中的成本效益表现尤为突出,在500美元预算内超越了多个闭源大模型。
小红书实验室的愿景是推动AI技术从“答题”转向“解决实际问题”,尤其关注多模态感知、复杂推理和持续学习能力。dots3-note preview的开源不仅是技术突破,更是对AI落地场景的探索。实验室选择从真实生活任务切入,与其平台属性密切相关——小红书用户每天分享大量涉及审美、预算、偏好等主观因素的生活内容,这些场景为模型训练提供了天然的土壤。通过开源模型和基准测试,实验室希望吸引更多开发者参与,共同推动AI技术向更实用的方向发展。
