DeepSeek用推理轨迹蒸馏小模型 7B、32B实现十倍规模推理能力
•8 阅读•3分钟•前沿
DeepSeekLlama通义千问推理蒸馏
Jesus Rodriguez••8 阅读•3分钟•前沿

背景与动机
DeepSeek 于 2024 年推出的 R1 大模型以其强大的链式思考(Chain‑of‑Thought)能力受到业界关注。随后,研究者注意到,模型在生成解题过程时会留下丰富的思考轨迹——包括错误尝试、纠正以及重新评估的全过程。这类轨迹蕴含了人类式的推理模式,却一直未被有效利用。
实验设计
- 数据来源:2025 年 1 月,DeepSeek 使用 R1 生成约 800,000 条完整解题记录,每条记录均包含逐步推理、错误修正以及最终答案。
- 筛选标准:对轨迹进行正确性与可读性过滤,剔除噪声与不完整步骤。
- 蒸馏对象:选取开源模型 Qwen(1.5B、7B、14B、32B)以及 Llama(8B、70B)进行纯监督微调,仅使用下一个 token 预测任务,未加入强化学习、逆 KL 或教师‑评审机制。
关键结果
- 32B 模型:在多个数学竞赛基准上取得突破,能够解答原本只有更大模型才能完成的题目,表现提升约 30%。
- 7B 模型:首次出现自我验证与中途分支推理行为,即模型在生成过程中主动检查并纠正前文错误,表现出类似元认知的能力。
- 整体趋势:小型稠密模型在经过思考轨迹蒸馏后,推理能力接近甚至超过十倍参数规模的基线模型,验证了轨迹级模仿的有效性。
业内反响
此结果在发布后迅速引发讨论。此前的研究普遍认为,仅模仿教师的最终答案(而非完整推理过程)难以让学生模型在推理时保持一致性。然而 DeepSeek 的实验表明,完整思考轨迹本身即是一种高质量的监督信号,能够直接转移教师的推理策略。
意义与展望
- 降低算力门槛:通过蒸馏,研发团队可以在算力受限的环境下部署具备高级推理能力的模型,推动边缘 AI 与本地部署的落地。
- 促进模型可解释性:思考轨迹的显式学习让学生模型在推理时留下可追溯的链路,为后续的可解释性研究提供素材。
- 开启新蒸馏范式:未来的工作可能结合多模态轨迹(如图文推理)以及自适应采样,进一步提升小模型的通用推理水平。
“我们不需要让学生模型在推理时重新走访教师的每一步,只要让它们看到完整的思考过程即可。” — DeepSeek 研发团队
小结
DeepSeek 的这项工作展示了思考轨迹蒸馏在提升小模型推理能力方面的潜力。它不仅挑战了传统的逆 KL 与教师‑评审框架,也为算力受限的 AI 部署提供了新的技术路径。随着更多开源模型加入此类蒸馏流程,AI 推理的规模与成本格局有望迎来重新洗牌。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。