成本暴降94倍!4B小模型如何在文档搜索中逆袭GPT-5.6 Sol?
在 AI 智能体(Agent)大行其道的今天,多轮文档搜索的成本和延迟一直是开发者头疼的难题。然而,Neon 与 Castform 最近联手交出的一份答卷,或许将彻底改变这一现状:他们通过强化学习后训练出了一款仅有 4B 参数的开源小模型。这款小模型不仅在文档搜索的准确率上硬刚甚至超越了 GPT-5.6 Sol,更将其单次推理成本压缩到了后者的约 1/94。
从“向量匹配”到“智能体搜索”的代价
要理解这项突破的含金量,首先需要看清当前搜索范式的演变。传统的文档检索主要依赖嵌入式搜索(Embedding Search),即将文档转化为数值化向量进行相似度匹配。但随着 AI 智能体的普及,这种简单粗暴的方式已无法满足复杂需求,“智能体式搜索”(Agentic Search)应运而生。
在智能体式搜索中,模型会像人类一样思考:将复杂问题拆解为多个子问题,自主规划搜索查询,检视初步结果后再次发起下一轮搜索,循环往复直到集齐所需信息。这种范式极大地提升了处理复杂问题的能力,但代价同样高昂——每一次循环都需要调用高性能大模型。以 Neon 提供的典型请求数据为例,使用 GPT-5.6 Sol 进行一次完整的搜索请求,耗时往往超过 10 秒,单次成本高达 0.087338 美元。对于需要高频、多轮检索的智能体应用来说,这无疑是难以承受的重负。
强化学习赋予小模型“搜索直觉”
为了打破“高精度必高成本”的魔咒,Neon 和 Castform 展开了精密分工。Neon 负责提供坚实的文档存储底座与基础搜索能力,而 Castform 则专注于训练小模型“如何聪明地判断该搜什么”。
Castform 并没有采用传统的微调,而是引入了强化学习(RL)。在训练过程中,模型先尝试完成搜索任务,系统则根据结果进行打分,并将反馈直接用于优化下一轮试验。值得一提的是,其奖励机制非常严苛:评估维度不仅看最终答案的正确性,还会细致考察模型是否精准定位了目标文档、是否引用了最恰当的段落。这种全方位的评估,硬生生把一个 4B 的小模型“逼”出了极高的搜索直觉。
数据说话:准确率登顶,成本暴降 94 倍
最终的测试结果令人瞩目。在 Neon 的验证环境中,这款经过 Castform 后训练的 4B 模型交出了平均评估分 1.447 的傲人成绩。作为对比,GPT-5.6 Sol 的得分为 1.369,而作为对照组的 GPT-5.4 得分为 1.377。这意味着,这款 4B 小模型不仅击败了当下的顶尖大模型,还刷新了该验证集的最高纪录。
如果说准确率的超越是“锦上添花”,那么成本上的降维打击则是真正的“杀手锏”。数据显示,该 4B 模型的单次推理成本仅为 0.000929 美元,相较于 GPT-5.6 Sol 的 0.087338 美元,成本直降约 94 倍。
结语:重塑智能体应用的成本结构
用 4B 的轻量级参数,吃下媲美甚至超越 GPT-5.6 Sol 级别的搜索精度,同时将推理开销压缩到几乎可以忽略不计。Neon 与 Castform 的这次合作,不仅证明了小模型在特定垂直任务上的巨大潜力,更意味着高度依赖多轮检索的 AI 智能体应用,其单位成本结构正在被彻底改写。未来,更便宜、更聪明的智能体搜索,或许已近在咫尺。
