Microsoft SkillOpt实现跨模型跨工具技能迁移,Codex表格技能在Claude Code上得分81.8

1 阅读3分钟前沿

背景与方法

SkillOpt 是由 Microsoft、上海交通大学、同济大学、复旦大学合作研发的文本空间优化器。它在目标模型保持冻结的情况下,通过一个优化模型读取带分数的 rollout 并提出 增删改 编辑,仅在分数严格提升时接受。最终导出的唯一文件 best_skill.md 即为可迁移的技能文档。

关键实验结果

  • 跨模型保留:在同一家族的 GPT‑5.4 系列中,SpreadsheetBench 在 mini 规模上保留 82% 的域内增益;LiveMath 在 nano 规模上出现负增益,仅保留 10%。
  • 跨工具迁移:Codex‑训练的 SpreadsheetBench 技能在 Claude Code 环境中得分从 22.1 提升至 81.8,略超 Claude Code 自训练的 80.4 上限。
  • 跨基准迁移:在 OlympiadBench → Omni‑MATH 上,各规模模型均实现正向增益,虽幅度不大,但均高于无技能基线。

可迁移性的根源

论文指出,表格类任务的可迁移性来源于 工作簿层级的过程化规则:结构检查 → 公式验证 → 静态值写回。此类规则与具体 CLI、文件 API 解耦,因而在不同 harness(Codex 与 Claude Code)之间保持效力。相对地,数学推理任务高度依赖模型内部的推理路径,跨工具保留率仅约 10%。

部署意义

  1. 一次训练,多处部署:训练成本一次性付出(0.6M‑46.4M token),在不同产品或平台复用时无需额外微调。
  2. 可审计的技能文档best_skill.md 为纯文本,可在数分钟内由领域专家审阅,所有编辑都有 edit_apply_report.json 记录,透明度远高于黑箱权重。
  3. 零推理时开销:优化模型仅在离线训练阶段使用,部署阶段仅执行文本指令,无额外推理成本。

展望

当前实验局限于同一家族的 GPT 系列,未验证跨家族(如 GPT → Qwen)或更复杂的多模态任务。若后续研究能在更广阔的模型与工具生态中复现类似保留率,SkillOpt 有望成为 可插拔的技能层,为企业级 AI 助手降低维护成本、提升可靠性。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。