编码智能体上不了生产,问题不在模型
2024 年编码智能体在 SWE-Bench 上突飞猛进,但企业真实仓库里把公开基准分数外推,落差往往十倍。Cognition 把评测重心迁到自研 Frontier Code Diamond,强调可合并性而不仅是测试通过;路由器的否决率比模型聪明度更影响长期成本;前置部署工程师的角色演化成给智能体写剧本的人。
4B 模型反超 GPT-5.6:开源做 agentic retrieval 的成本拐点
Neon 和 Castform 团队用企业已有 Postgres 数据做 RL 后训练,把 4B 开源模型在 agentic retrieval 任务上的准确率做到与 GPT-5.6 Sol 持平,但单次成本只有约 1/100。对成本敏感的独立开发者和小团队,这是一条被低估的路径。
Celld:把 Cloudflare 那套 Durable Objects 搬回你自己的机器
Deno 团队开源的 Celld 用 S3 兼容对象存储做协调,让 Cloudflare Workers 与 Durable Objects 完全自托管,每个对象一个 SQLite、按名寻址、按需复制。1.7k stars,给想脱离 Cloudflare 锁定又舍不得开发体验的小团队多了一条路。
Cloudflare 把内部跑了几个月的 agent 平台开源了
Cloudflare 把内部所有员工都在用的 Cloudflare OS 开源,企业可自托管,把 agent 工作流、文档生成、可修改小应用、安全治理做成一个完整的内部平台。给独立开发者和出海小团队一个能直接借鉴的 agent 落地样板。
TIME 给 AI bot 单独开了一个 markdown 版,里面塞满了广告
Vincent Schmalbach 实测发现 TIME 给 ClaudeBot、PerplexityBot、OAI-SearchBot 返回的是原版 1/23 大小的 markdown,由 Mobian 按 token 计费插入赞助 FAQ;Googlebot 仍拿到原版 HTML。出海站点如何在 GEO 时代重新设计内容策略,是新课题。
清华系 Physical AI 数据公司 Ropedia 完成数千万美元天使轮
总部新加坡、硅谷设办公室的 Ropedia 完成数千万美元天使轮,投资方覆盖东南亚头部 VC 与 Google、a16z、NVIDIA、Amazon 相关机构。其开源数据集 Xperience-10M 已被 Qwen-VLA、MolmoMotion、ACE-Ego-0 等模型采用,累计下载 270 万次位列具身智能数据集全球第一。
前安克高管做智能房车 Evotrex,2 亿融资后 2027 年量产
松鼠动力完成超 2 亿元 A 轮系列融资,首款产品 Evotrex-PG5 已在 CES 2026 发布、起售价 12 万美元。75 升油箱加 43 度电池组合的增程方案可输出 270 度电,订单超内部预期,顶配 Premium 占比 90%。
2000 条记忆错位排了 3 小时:大模型长记忆的两个一致性坑
线上 2000 多用户的长记忆错位,排查发现是 ORDER BY created_at 加 LIMIT/OFFSET 在并发写入下分页漂移。文章给出 100 行 pytest 一致性测试框架,强制 keyset 分页、时区统一,让记忆存储从黑盒变成可验证组件。
10 美元一月跑遍国产模型:OpenCode Go 套餐把 Coding Agent 算力打到地板价
OpenCode 推出 5 美元首月、10 美元续费的 Go 套餐,一个 API Key 串起 DeepSeek V4 Flash、Qwen3.8 Max、Kimi K3、GLM-5.2、MiniMax M3 等多款主流模型。DeepSeek V4 Flash 缓存读取价 0.0028 美元/百万 token,单次 Coding Agent 请求低至 0.0006 美元。
DeepSeek V4 Flash 能在本地跑了,但 32GB 内存先别折腾
Unsloth 公布 DeepSeek V4 Flash 0731 的 GGUF 量化版本,284B 总参数、13B 激活、1M 上下文。Terminal Bench 2.1 从 61.8 拉到 82.7,DeepSWE 从 7.3 拉到 54.4。110GB 是底线,128GB 起步能跑稳,192GB 起选 UD-Q8_K_XL。