Jev来了:一个不会写句子的模型,凭什么让LLM圈紧张
上周我刷到一条发布,说有个 AI 模型「完全不会写字」。
不是文风不好的那种不会,是字面意思:它生成不出一个完整的句子,没有对话界面,不输出任何文本,连一段像样的解释都给不了你。就这,发布四天,Hacker News 头版、B 站实测视频、海外科技媒体一篇接一篇,融资传闻、对标 OpenAI,满天飞都是「新范式」。
它叫 Jev,做它的公司叫 TypeSafe,创始人 Diogo Almeida,在 OpenAI 待过,参与过 ChatGPT 指令遵循那条线的研究。9 月 14 日官宣,之前隐身了两年,据 Techmeme 说拿了 4000 万美元种子轮。
我的第一反应跟很多人一样:一个不会说话的模型,有什么好吵的?
但把它的技术文档和几篇独立实测啃完之后,我改了主意。这事值得认真聊一篇。它戳的不是某个产品的短板,是整个 LLM 范式的底座。我们花了三年、烧了几百亿美元教会机器说话,然后发现「说话」这件事本身可能就是多余的——至少当软件只需要机器做个决定的时候。
※ ※ ※
LLM 的「写作税」:为了说出「垃圾邮件」,它得把字打完
先讲清楚 LLM 的工作原理里藏着的尴尬,因为 Jev 的整个卖点都建立在这上面。
大语言模型是自回归的。它每前进一步,只能吐出一个 token,然后把刚吐出来的东西再吞回去,决定下一个 token。你问它「这封邮件是不是钓鱼邮件」,它明明心里(如果有的话)已经「知道」答案是“是”,但它还是得把「是」「。」「建议」「用户」「删除」这些字一个一个写出来,你才有机会读到。
一个判断,两秒钟。多出来的时间,全花在「写」上。
更难受的是工程侧。软件要的从来不是一个答案句子,而是一个能 if 的东西。所以过去两年,所有人都在给 LLM 套缰绳:JSON mode、函数调用、结构化输出、schema 校验,然后代码里写满 try-except,处理它偶尔吐出来的坏 JSON、编造的字段名、不存在的工具参数。干过 agent 开发的人都认识这个环节——「幻觉工具调用」,模型发明了一个你根本没有的函数,然后你的流水线在半夜三点炸掉。
换句话说,我们让 LLM 说人话,然后再花大力气把它说出来的话重新翻译成机器话。这两道工序里,第二道纯属浪费。
※ ※ ※
Jev 的赌注:把「说话」这个功能整个砍掉
Jev 的做法简单粗暴:从输入到输出,全程不经过「文本」这个中间商。
你喂给它一段非结构化的状态——一封邮件的原文、一张工单、一段程序运行日志——外加一份你事先定义好的问题清单。它返回的不是文字,是带类型的概率化决策。官方原话我抄一遍,因为确实精辟:「unstructured state in, typed probabilistic decisions out」——非结构化状态进,类型化概率决策出。
它的 API 一共就三种问法。Choice,从你给定的选项里挑一个,返回每个选项的概率;Score,按你定义的等级打分;Noul,回答「这个条件成立的概率是多少」这种是非题。答案空间在调用之前就锁死在你的 schema 里,模型的输出在数学上不可能越过这个边界。
它不会给你吐出一个语法错误的 JSON,因为根本没有 JSON 可吐。它给你的是一个对象,类型是你定义的,值是一个校准过的概率。就这么点事,让 LLM 生态里那一整层「解析-校验-重试」的胶水代码直接失去了存在意义。
速度也是这么来的。TypeSafe 说它用了一套全新的架构加一个「并行采样器」:不再一个 token 一个 token 地写,而是一次前向传播,把所有问题的答案同时算出来。官方给的端到端延迟是 70 到 500 毫秒,对照他们自己测的前沿 LLM 做同类任务,3 秒到 329 秒都有。价格更狠:输入每百万 token 收 4.2 美分——LLM 普遍收 20 美分到 10 美元——输出,不收费。因为输出是几个概率数字,不值钱。
训练方法他们叫 RLCD,全称「为校准决策而做的强化学习」,摆明了是对着 RLHF 打的:RLHF 优化的是「人类评测员觉得好听」,RLVR 优化的是「程序能验证对错的生成」,RLCD 优化的是「概率要诚实」——模型说 70% 的把握,那它就得有七成时候是对的。
名字本身也是声明。Jev 自称第一台「System One 模型」,出处是卡尼曼:系统一是快直觉,扫一眼就知道那封邮件是垃圾,不用推理;系统二是慢思考,一步一步验算。LLM 的 chain of thought 是在模仿系统二,而 Jev 干脆押注系统一。
TypeSafe 放了两个演示,最出圈的一个是用 Jev 玩文字版 Doom。注意,不是看图决策——那还得有视觉模型——是把游戏状态结构化之后直接喂给它,它每步返回「往哪走、打不打」的类型化决策,每秒 10 次查询,团队一开始担心账单,跑下来一小时 7 美元左右。
※ ※ ※
「不会幻觉」这句 slogan,一半是真的,一半是偷换
每次有厂商跟我说「我们的模型不会幻觉」,我都会先去看它对幻觉是怎么定义的。Jev 也不例外。
真的一半:它确实造不出一个不存在的答案。输出被锁在 schema 里,选项是你给的,分数区间是你定的,它没法无中生有。这个意义上,「结构化输出错误率 0%」是硬保证,不是话术。
偷换的一半:schema 合法,不等于判断正确。
有个博主说得干脆:Jev 破不了 schema,但它照样能投错票。它不会发明一个选项,但它可以自信地在你给的十个选项里挑错九个,还附赠一个漂亮的、校准过的高置信度。幻觉从「说出来」挪到了「选出来」,但错的概率没有消失。
更要命的是它的不可解释。TypeSafe 自己也承认,这是明牌:Jev 写不出一句话,也就给不出任何解释。没有思维链可以审查,因为压根没有链。它能告诉你「这个活儿干砸了,概率 91%」,但它没法告诉你砸在哪、怎么修。对分类器这是特性,对需要复盘的工程团队这就是天花板——出事之后,你手里只有一个概率,没有故事。
官方文档难得地诚实,反复劝你别把它当 agent 用:规则留在代码里,问题问窄一点,「把它当一个模糊的 if 语句,别当一个智能体」。这句话我觉得是整个发布里最有分量的技术表态。
※ ※ ※
通稿的 193 倍,和实测的 5 倍
然后是我最烦、但也最理解的部分:数字。
TypeSafe 首页的标头条写着「快 193.6 倍,省 444.6 倍」。博客正文里变成「对 System One 型任务快 40 到 200 倍」,创始人自己的发布线程又变成「20 到 200 倍、省 40 到 400 倍」。三组口径,一套比一套客气。他们自己的解释是首页那对数字来自 workflow evals、且预期真实世界收益「落在偏高区间」。
问题是这个 workflow evals 本身的基准就有争议。TypeSafe 在 evals.typesafe.ai 发布了一套工作流评测,分怎么算的?拿 GPT-6 Astra 和 Fable 5.1 两个前沿 LLM 输出概率的平均值当参考答案。也就是说,这套分数量的是「你跟两个大语言模型商量出来的共识有多一致」,不是「你对不对」。一台号称跳出 LLM 范式的机器,考卷的标答是两个 LLM。这画面有点黑色幽默。
真正的独立数据在别处。英国一家做活动listing的公司 Near Here 拿 50 条真实审核任务测了 jev-1.13.0:准确率 96%,对照 Mistral Small 4 是 84%,Gemini 3.5 Flash-Lite 是 86%;平均每条决策 0.59 秒,千条成本 4.3 美分。结论:比那个小模型快五倍、便宜不到九倍,不是通稿的两百倍。5 倍对 193 倍,差着两个数量级,这才是应该进决策会的数字。
另一篇十六模型对照的实测(150 篇文本、2400 次调用)我觉得更有意思:在「一秒内返回」这个价位段,Jev 是测到的校准最好的模型,而且是唯一一个会稳定「承认自己不确定」的;全部十六个模型里敢把概率压在模棱两可区间的只有四个,四个里面只有一秒内交付的是 Jev。但它不是 accuracy 冠军——有几个模型分数比它高,其中一个在「敢于示弱」这个指标上还赢了它,只是那个模型要 1.7 秒。
1.7 秒。这正是 Jev 的处境写照:通用模型越来越快、越来越便宜,追到 System One 家门口只是时间问题。
※ ※ ※
我的判断:不是杀手,是拆界的
看完这一圈,我对 Jev 的定位跟通稿不一样,也跟「又是换皮模型」的嘲讽不一样。
它不是来杀死 LLM 的。Doom 也好、审核也好,那 96% 准确率照样有 4% 的错,企业不可能把一个不能解释的决策器放到终审位。它真正在拆的,是另一条边界:过去我们把所有要「理解一点语义」的活都顺手丢给 LLM,包括那些本质上只是一个分类、一个门控、一次 if 的活。Jev 证明了这条路上有一整块地皮不属于语言模型——不需要语言、不需要生成、只需要「读懂状态,给出带概率的判断」。
所以我最看好的形态,恰恰是 TypeSafe 自己没多讲的那个:Jev 当闸门,LLM 当大脑。海量请求先过一遍 0.5 秒、4 美分千次的系统一,置信度高的直接放行,低风险的进自动化,「不确定」和高风险的才升级给昂贵的推理模型或者真人。这个漏斗里,System One 模型赚的不是 LLM 的钱,是 LLM 前面那 90% 流量本不该花的钱。
一个不会写句子的模型,逼着所有人重新回答一个问题:我们到底需要机器「智能」,还是需要机器「有用」。过去三年,我们把这两个词想当然地绑在了一起。Jev 把它们拆开,甩在桌上。
至于两年后回看,这次发布算不算「新范式」,说实话我不知道。但有件事我现在就确定:一个连“你好”都说不出口的模型,让全行业的聊天机器人集体紧张了一个星期。就冲这个,它也够写进这一年的 AI 史了。
这个系列我打算接着拆下去:
- ▪ 架构篇:并行采样器和 RLCD 训练法到底在赌什么,为什么说它跟 Transformer 自回归是两条路
- ▪ 上手篇:Choice / Score / Noul 三种题型的 API 实操,把手头某个 LLM 分类环节换成 Jev 要改哪几行代码
- ▪ 工程篇:「Jev 当闸门,LLM 当大脑」的漏斗架构怎么落地:阈值、灰区、升级策略、审计回路
- ▪ 对决篇:拿同一批真实业务数据,Jev vs 小参数 LLM vs 大模型 JSON mode,成本和准确率摆开了算
想追读的可以先收藏,或者直接留言你最想先看哪一篇。
※ ※ ※
信息来源:TypeSafe AI 官方发布与评测站(evals.typesafe.ai,2026-09-14/15);Techmeme(融资报道);The Cherry Creek News 对 Jev 宣称数据的核查(2026-09);Near Here 50 条真实审核任务实测(转引自上述报道);DataCamp《Jev: TypeSafe's System One Model》;wotai.co 十六模型对照实测(2026-09-18);rickhigh.substack 与 dev.to 社区评论。文中所有厂商数据均标注了出处口径,独立实测与官方宣称不一致处以独立实测为准。
评论 (0)
登录 或 注册 后参与讨论。