4B 模型反超 GPT-5.6:开源做 agentic retrieval 的成本拐点

AI 摘要

Neon 和 Castform 团队用企业已有 Postgres 数据做 RL 后训练,把 4B 开源模型在 agentic retrieval 任务上的准确率做到与 GPT-5.6 Sol 持平,但单次成本只有约 1/100。对成本敏感的独立开发者和小团队,这是一条被低估的路径。

2026-08-07·出海情报站·阅读需6分钟

GPT-5.6 Sol 跑一次多轮 agentic 检索,端到端延迟超过 10 秒、费用约 0.03 美元——这在高频调用场景里基本不可用。Neon 团队和 Castform 团队联手做了一件事:用企业 Postgres 里已有的数据做 RL 后训练,把 4B 开源模型拉到同样的准确率,而单次成本只有闭源方案的百分之一左右。

从 embedding 到 agentic retrieval 的范式切换

2022 年前后,整个行业押注 embedding 搜索。每家数据库厂商都加上了 pgvector 之类的扩展,工程师手工搭 RAG 管道,本质上就是某种 embedding 相似度搜索。

到 2025 年,agent 开始抬头。开发者把大问题拆成多跳检索任务,让模型规划并循环检索。每多一轮迭代,就多一次闭源模型调用,请求的总体成本和延迟持续上升。一个典型的多轮搜索请求,用 GPT-5.6 Sol 跑下来要 10 秒以上,0.03 美元起跳。

开源小模型便宜得多——单价只有闭源的百分之一。但裸开源模型的检索能力明显落后。RL 后训练在搜索这类窄任务上能把开源模型拉齐甚至超越闭源,同时单请求成本下降一个数量级。

Castform:让后训练像 prompt engineering 一样容易

Castform 的切入点是把 RL 后训练做成「prompt 工程一样易上手」的工具。开发者指定任务(回答用户问题)、环境(搜索工具)和奖励函数(答案是否正确),Castform 负责整个 RL 循环:模型尝试任务、奖励打分、反馈信号引导模型 hill-climb 到最优表现。

过去想做这件事,企业得自己准备干净的任务数据集和奖励函数。但绝大多数公司没准备好——于是两个常见的理由被抛出来:「我们没有训练数据」「微调太难,infra 我们没有」。Castform 同时回应这两点:它把现有语料变成训练任务,再跑 RL 循环教会开源模型怎么用这些数据。

为什么 Neon 适合做这件事

Neon 在 Lakebase Postgres 上做了 Search 扩展,让 Castform 能直接对 Neon 里的数据做检索。每次多轮 rollout 里模型反复调 Lakebase Search,每次调用都带来一波突发流量——Neon 的动态算力伸缩把这些尖峰吸收掉,高峰时给低延迟搜索,空闲时把算力降下来。

对独立开发者的实际意义

对成本敏感的小团队和独立开发者,这意味着 agent 检索不再是闭源模型的专属。开源 4B 模型 + 自有数据 RL 后训练 + Neon 这类动态算力存储,组合起来能跑出与 GPT-5.6 Sol 同等质量、单价百分之一的服务。

一个 100 万次/月调用量的 agent,原本要 3 万美元的服务费,现在可以压到 300 美元上下。这不是渐进优化,是 agent 经济性的范式切换。

来源:HackerNews