一个不会说话的 AI

最近出了一个新模型,Jev,它只做一件事,判断。没法聊天,没法写代码,甚至没法生成文字。你问它一个问题,不像以往我们认知里面的大模型,给你分析,给你答案,Jev 只给你一个结论。

它有三种判断类型。

类型做什么举例
Choice从给定选项中选一个这条工单属于退款、技术故障还是售前咨询?
Noul返回「是」的概率这条消息是否表达了紧急需求?
Score按你定义的等级打分这篇文档与用户问题的相关程度如何?

就这些。没有长篇大论,没有推理链,就是一个判断结果加一个置信度。

这听起来好像很受限,但已经有人拿它做了一些还挺有趣的事情。比如 Chrome 扩展,刷推特的时候,每条推文一出现就被标成「Breaking」「值得读」或者「AI Slop」。推文加载的同时就标好了,相当于有个人坐在你旁边帮你秒筛信息流。还有人拿它每秒读一次比特币行情,判断涨跌,自动下单。粗糙是粗糙,但重点是这个频率。每秒决策一次,如果是传统模型,这个成本根本扛不住。

过去的大模型都在努力学怎么更好地回答问题。Jev 解决的问题不一样。如果最后真正需要的只是一个可以执行的判断呢?用户只想知道要还是不要,A 还是 B,继续还是停止。

思考,快与慢里把人的思考分成两种。系统一是快思考,自动的、直觉的。系统二是慢思考,需要一步一步分析。现在的 ChatGPT、Claude、各种 Reasoning model 都在卷系统二,Jev 走的是系统一的路线。它认为世界上存在着大量不需要长篇大论的智能任务,只需要 Yes or No。确实,对我们人类来说,绝大多数东西都是决策判断。选择题是决策判断,很多大题背后其实也是一堆隐含的决策和判断。

那实际跑起来怎么样?Nate Herk 用 1000 封邮件做了基准测试,同时跑 7 条分类规则。Jev 并行处理,6 秒,9 美分。同样的活交给 GPT 5.6 Luna,5 分钟,62 美分。12 倍价格、46 倍时间。他的控制台显示跑了近 20,000 次请求,总共花了 85 美分。

几个具体的用法比这些数字更有意思。比如会议录音打分。Jev 总结不了会议,但可以打分。设一堆评分项,有没有明确下一步、有没有人表达沮丧、决定是不是在等某个人。跑完几百场会议数据一摊开,管理问题自己浮出来了。用判断题拼出了分析题的效果。又比如垃圾邮件和内容审核,入库前先过一道 Jev,反垃圾、打标、风险判断,成本几乎可以忽略。还有人把 Jev 挂在 AI agent 的 hook 里当看门狗,每 20 次工具调用跑一次「任务有没有跑偏」的判断,跑偏就停,强行收敛目标。成本几乎为零。有人总结得很准,需要分类、打标、多选一的场景有价值,任何创造性任务基本没价值。

对我而言,目前能够运用的场景有两个,一个是信息筛选,就是值不值得读,可以是 TG 上面的群聊信息,可以是我自己 clip 下来的文章。第二个是我的邮箱需要进行分类整理,那么它能够很快的做决策,是不是广告,需不需要保留,哪些是可以阅后即焚的。

这些场景有一个共同的架构。Jev 做第一道筛选,强模型做后续处理。比如 5000 条 YouTube 评论先用 Jev 分类,挑出值得回复的再喂给 ChatGPT 做深度分析。量大、快、便宜的判断层交给 Jev,复杂的生成和分析交给强模型。

它能做到这些,靠的是一套叫 RLCD 的训练方法,全称 Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。之前的方法各有侧重。RLHF 优化的是人类更喜欢哪个答案,RLVR 优化的是答案能不能被验证。RLCD 优化的是这个决定到底对不对。如果模型说「我有 90% 的把握」,那它是不是真的接近 90%?

这个校准才是最重要的。想象一个自动化系统。置信度大于 0.9,自动执行。0.7 到 0.9 之间,交给更强的大模型复核。低于 0.7,由人来决策。整个分层能跑起来,前提是 Jev 说的「我有多确定」可信。而且判断的问题可以一次性并行问,不用像传统 LLM 那样一个一个 token 往外生成。Jev 本质上有点像一个拥有世界知识和语义理解能力的超级 if

Jev 这个名字来自经济学里著名的杰文斯悖论,提出者 William Stanley Jevons。19 世纪的时候蒸汽机越来越高效,理论上烧同样的煤可以干更多的活,人类应该因此少烧煤才对。结果刚好反过来。效率提高、用煤越来越划算,越来越多行业开始烧煤,整个社会的煤炭消耗量反而暴涨。给模型起这个名字,是相信 AI agent 会发生同样的事。现在模型越来越贵、越来越强,但我们日常中真的需要这么高质量的模型吗?如果大量的判断和决策只需要一个便宜的小模型就能搞定,那这个世界会发生什么?

当然,它的限制也很明显。上下文窗口只有 64K token,远低于 Claude 和 GPT 的百万级,大文档一次塞不进去。有用户反映中文场景下准确性体感更差。同一请求里的各个问题相互独立,不能靠前文推断,需要分组推理的场景不适用。想在生产环境用,必须先跑 eval,准备一批标准答案把 Jev 和其他模型都过一遍,比准确率和成本的平衡点。

AI 不一定需要生成东西,也可以用来判断。