大语言模型是怎么学会“思考”的?
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达


大模型的“思考”是工程上的简写,泛指指模型生成、比较、检查和修正解题步骤的能力。它不等于模型拥有人的意识,也不代表模型公开写出的每一步都是可靠的内部推理。
同一道题,普通聊天模型可能张口就答;换成推理模型,它会先停一会儿,再给出拆解、计算和检查后的结果。
这很容易让人产生一个印象:模型以前只会接话,现在突然学会思考了。
真实过程没那么神秘。大模型的能力像一名学生逐步长出来:预训练让它读了大量材料,指令微调教它怎么答题,偏好对齐让它知道什么回答更合适,强化学习再用奖励反复调整解题策略。到了实际使用时,系统还可以多给它一些计算时间,并接上搜索、代码和验证器。
它没有被塞进一颗“逻辑芯片”,而是在训练和反馈中,学会了更容易拿到高分的解题路线。
01|先看全程:能力不是一次训练出来的
今天常见的推理模型,大致会经过几类训练和运行阶段。
预训练 → 指令微调 → 偏好对齐 → 推理强化 → 推理时计算
这条线不是所有厂商都照抄的统一配方。有的阶段会合并,有的模型会加入蒸馏、合成数据、工具训练或多轮筛选。理解它最省事的方法,是把各阶段看成不同课程。
预训练负责“见多识广”;
指令微调教答题格式;
偏好对齐纠正行为;
推理强化训练解题策略;
推理时计算则发生在考试现场,让模型多尝试几条路。
02|预训练:先学会“接下去最可能是什么”
大语言模型最基础的训练任务,是根据前面的Token预测下一个Token。
听起来很朴素,规模放大后却不简单。为了把下一个词猜准,模型要逐渐捕捉语法、概念关系、常见事实、写作结构和代码模式。读到“水在标准大气压下达到100摄氏度会……”,只背词频不够,它还得把温度、物态和语境关联起来。
可以把预训练想成让一个学生长期泡在巨型图书馆里。它看过教材、小说、论文和程序,脑中形成一张压缩后的关系网。但没人专门告诉它:收到用户问题时,应该先列条件、再计算、最后核对。
所以基础模型往往“知道很多”,却不一定按要求交作业。它可能续写问题、模仿网页语气,也可能给出看似流畅的错误答案。预训练铺好了知识和表示能力的底盘,离稳定的解题助手还有一段距离。
03|指令微调:先照着好答案练习
接下来是监督式微调,也常简称SFT。训练者准备一批“指令—回答”样本,让模型模仿高质量答案。
样本里如果包含分步解法,模型也会学习常见的拆题方式:先识别已知条件,再建立关系,算出结果后做检查。这像老师先示范几道例题,学生照着练,慢慢形成答题习惯。
2022年的Chain-of-Thought研究还说明了一件重要的事:对足够大的模型,只在提示词中放入少量带中间步骤的示例,也能把部分多步推理能力“引出来”。这里要分清,提示词是在使用阶段引导模型;SFT则会真正更新参数。二者都能改变回答方式,作用位置不同。
模仿也有上限。示范答案写错了,模型会学错;训练题覆盖不够,换个问法就可能失灵。更麻烦的是,文字很像推理,不代表逻辑真的成立。模型完全可能写出一串像模像样的步骤,最后只是把错误包装得更完整。
04|RLHF:让模型知道“哪种回答更合适”
只靠标准答案,很难覆盖开放式对话。两个回答可能都没有明显事实错误,但一个更清楚、更安全,也更符合用户意图。于是训练进入偏好对齐。
InstructGPT展示过一条经典RLHF流程:先用人工示范做SFT;再让标注者给多个回答排序,训练奖励模型;最后用强化学习提高模型获得高奖励的概率。Anthropic提出的RLAIF则把部分比较工作交给另一个模型,并用一组原则约束评价。
强化学习可以简单理解成“不给整套标准动作,只告诉你这次得了多少分”。模型不断尝试,逐步增加高分回答出现的概率。
但RLHF的高分通常混合了有用性、清晰度、安全性和人的偏好。人更喜欢一段自信、完整的回答,不代表其中每个推导都正确。RLHF擅长把模型训练得更像一个合格助手,却不会自动补齐所有逻辑能力。
05|为什么数学和代码成了推理训练场
推理强化真正容易发力,是因为数学和代码提供了更硬的尺子。
一道数学题的最终答案可以精确比对;一段代码可以跑单元测试。模型生成多条解题轨迹,答对或通过测试就得分,失败就扣分。训练不必为每一道题人工写出唯一的标准过程,这类方法常被称为可验证奖励强化学习。
DeepSeek-R1-Zero是一个典型公开案例。按论文和官方仓库的描述,它在没有先做SFT的情况下,直接从基础模型开始大规模强化学习,逐渐出现更长的推理、反思和自我验证行为。随后发布的DeepSeek-R1又加入冷启动数据和多阶段训练,改善可读性、语言混杂与通用表现。
这像教学生解题时,不先规定必须写哪套公式,而是把大量可判分的题交给他。做对有奖励,做错再换路。训练久了,模型可能找到人类示范中没有明确写出的策略。
问题也随之出现:只看终点,模型可能走一条碰巧答对的歪路,或者利用评分器漏洞。奖励设计不严,模型学会的就不是推理,而是“怎么讨好裁判”。
06|过程监督:不能只看最后一格答案
结果监督只检查答案,过程监督会给中间步骤打分。
比如一道计算题最后得到42。结果监督只问42对不对;过程监督还会检查单位有没有统一、公式是否适用、第二步有没有把加法写成乘法。OpenAI在MATH数据集上的研究报告称,逐步奖励正确推理的过程监督,在该实验中优于只看最终答案的结果监督。
过程监督更细,却更贵。人工逐步标注耗时,自动过程奖励模型也可能判断错。工程上常把几种办法混在一起:最终答案或测试用例负责硬验收,过程奖励帮助选择路线,规则和工具再检查关键节点。
换句话说,终点要验票,沿途也要设检查站。
07|推理时计算:考试时多给几张草稿纸
模型训练完,并不代表一次请求只能走一条路。系统可以让它多生成几个候选方案、延长推理、调用计算器或代码,再用验证器挑选结果。这就是推理时计算,也叫测试时计算的一部分。
OpenAI在o1技术说明中称,模型表现会随训练阶段的强化学习计算量和使用阶段的“思考时间”增加而改善。这里的关键不是让回答写得更长,而是给模型更多机会分解问题、发现冲突和改换策略。
2026年Google Research的一项研究又补了一层解释。研究者发现,推理Token有时像计算缓冲区,让模型获得更多前向计算;中间生成的相关事实也可能起到“热身”作用,帮助召回目标事实。不过,推理中只要混入错误事实,最终答案就更容易被带偏。
因此,“多想一会儿”不是免费升级。它会增加延迟和Token成本,也不保证单调变好。简单分类题没必要跑长推理;高风险计算则不该只靠模型自检。
08|一个实战:让模型负责拆题,让程序负责验算
假设业务问题是:
“仓库有360件货,6名员工每人每小时处理8件。设备中途停机15分钟,8小时内能否完成?”
这类题对人不难,却很适合展示可靠推理的工程做法。
第一步,模型提取条件,并明确假设:停机期间所有人都无法处理货物。第二步,模型写出计算关系。第三步,不让模型自己相信自己,而是把数字交给Python或计算器复算。
有效工时7.75小时 → 可处理6 × 8 × 7.75 = 372件 → 余量12件
可处理372件,大于360件,所以能完成,余量是12件。如果模型文字结论与程序结果不一致,系统把差异送回模型重试;涉及排班或合同承诺时,再交给人确认。
这套做法比要求模型“请认真思考三遍”可靠。提示词能提醒,工具能核验,流程能拦住错误。生产系统也不必公开模型完整的内部思维,只需保留关键假设、可核验步骤、工具结果和审计记录。
09|真正的推理能力,来自一套组合拳
回头看,大模型学会“思考”并没有一个单独开关。
预训练提供知识与模式,SFT给出示范,偏好对齐修正行为,可验证奖励强化解题策略,过程监督检查路线,推理时计算增加尝试空间。到了应用里,搜索、代码、验证器和人工审批又把模型能力变成可交付结果。
也因此,选推理模型不能只看“思考了多少Token”。更该看任务正确率、验证方式、失败成本、延迟和预算。客服分类可以快速直答;财务计算、代码修改和研究分析,应把证据、工具校验和人工接管一起设计进去。
模型能生成更长的推理轨迹,只说明它多铺了几块踏脚石。每一块是否结实,还得靠奖励、评测和外部验证来确认。
结语
大模型最初学会的是预测语言,后来才在示范、偏好和奖励中,逐步形成更有效的解题习惯。
所谓“思考”,与其说是机器突然醒了,不如说是训练者把答题、判分、复盘和验算做成了一套可重复的课程。也可以把大模型学会“思考”比作培养一名学生:预训练是让他泡在图书馆里大量阅读,指令微调是老师带着做例题,强化学习是通过考试分数不断纠正解题方法,而推理时计算则是在考场上多给他几张草稿纸和一次验算机会。所谓“思考”,就是他从“见过很多题”,逐渐学会“怎么拆题、怎么找路、怎么检查答案”。
真正可靠的AI推理,不是让模型独自想得更久,而是让它在该停顿时停顿,在该调用工具时调用工具,在该被检查时接受检查。

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事





