500 美元 RL 微调让 9B 开源模型在商品审核上超越所有闭源旗舰
Fermisense 在一篇深度技术分析中披露了一个引人注目的实验:用 500 美元对 9B 参数的开源模型进行 GRPO 强化学习微调,在商品目录审核任务上以 87.3% 的准确率击败了所有闭源旗舰模型——Claude、GPT-5 等最高仅达到 76.9%。更关键的是成本:每千条审核仅 0.5 美元,而最贵的闭源方案需要 172 美元。
这个实验揭示了一个正在被越来越多企业验证的规律:在具体业务场景中,用小模型做专门化微调,效果和成本都优于直接调用通用大模型。Bridgewater 用类似方法训练的投资文档筛选模型比最佳闭源模型少犯约 30% 的错误;Harvey 针对法律场景微调后的模型同样超越了 GPT-5.5 和 Claude Opus 4.8;Intercom 的 Fin Apex 用垂直模型在更低的成本下解决了更多客服问题。
Ramp 的跨行业数据显示,AI 支出最高的四分之一的公司在 2022 年 11 月至 2025 年 12 月间营收增长超过两倍,而零 AI 支出的公司仅增长约 15%。差距的关键不只是「用了 AI」,而是能否将模型嵌入到专有工作流中,并用自身数据持续优化。
Fermisense 总结的赢家策略很清晰:先用闭源旗舰模型完成流程自动化原型验证,积累输入、决策和修正数据;然后在数据达到规模后转向用 RL 微调小模型,以百分之一的成本获得更好的性能,实现「拥有自己的智能」。