新模型 Jev 由 TypeSafe AI 推出,创始人 Diogo Almeida 是 OpenAI 早期核心研究员,也曾参与把 InstructGPT 与 RLHF 做出来的那批工作。Jev 不生成自然语言、不承担对话,连最基础的文本生成能力都被切掉,只向程序输出带精确概率与置信度的决策判断,发布几天内便刷屏海外技术社区。Diogo 随后做客硅谷播客 Latent Space,与主持人 Swyx 聊了两个多小时,完整解释了为什么要反着老东家的路线,去做一个“闭嘴干活”的 AI。团队把这类模型称为“系统 1 模型”:机器原生、高可编程,核心设计原则是以代码作为唯一的消费者,公司名 TypeSafe 也由此而来。
对外暴露的底层原语只有三个:Choice 对应枚举上的 switch / match 分支,Score 对应按大小阈值做排序与过滤,Noul 的命名取自数学家 Bernoulli,本质是布尔式置信概率,映射到 if 条件分支。输入端鼓励直接传结构化 JSON 对象——系统状态、执行指令、评判标准各自成字段,而不是拼接一大段字符串模板。把 System Message 当成一个庞大的全局变量、把所有上下文和规则一股脑塞进去、再指望模型一次全执行到位,被视为根本性的工程错误;正确做法是拆成上百个微小判定,让每个决策可度量、可 Debug、可纳入单元测试,也不会因为上下文退化而在长提示里遗忘规则。
他反对在底层 API 上做安全拒答。程序逻辑里“拒绝执行”本身就是类型错误:模型作为依赖库静默部署在后台时,终端用户一句略带敏感词的话就可能让整个系统无预警抛异常;安全对齐属于面向终端消费者的产品层职责,底层要的是能力对齐,即绝对服从并准确执行当前用户的指令。开发者真正需要的也不是逐字节的确定性,而是鲁棒性——目前 API 不提供随机种子,同一语义的输入在多组随机数下应稳定给出语义一致的输出。同理,公开基准测试容易被刷分、训练中也会被动过拟合,盲目微调则会毁掉通用模型在百万级任务上获得的泛化能力,因此微调暂不提供,替代方案是概率校准加模型级联:高置信度直接采纳,模糊区间动态路由给更大的模型。
任务范式上,团队提出 RLCD,把北极星定为“程序在闭环中调用并整合 AI”(programs in the loop),不再拟合人类偏好,而是彻底消除人在回路。数据被放在最高优先级:模型能力的上限由数据决定,可靠性能否做到多个“9”也由数据决定,因此刻意避免用真实用户数据训练——用户提问遵循幂律分布,直接拿来只会过拟合当下高频场景;目标是面向数年后的底层基础设施,预先覆盖尚不可见的边界情况。数据团队要做的事更接近工匠与艺术家:定位能力参差不齐的边界,并把它在所有逻辑维度上打磨平滑。
落地数据同样激进:发布不足一周,日均处理 Token 已突破一万亿,深夜仍维持高负荷,说明流量主要来自机器程序的自动化调用而非人类尝鲜,系统可用性指标高于部分头部服务商。四类核心场景被归纳为暗数据(企业沉睡数据资产的批处理)、高频实时(把推理嵌进系统核心循环)、全面验证(对慢思考模型的生成结果做毫秒级质检)与智能软件(原生可组合的新型软件)。coding agents 是当下最集中的方向,而 Claude Code、Codex 一类架构都还建立在“单一模型世界”的假设之上,谁先利用可组合原语把体验做透,谁就可能拿到竞争壁垒。长期目标是把 AI 退居软件幕后:2019 年现代企业软件已极具商业价值,到 2026 年除了界面上多一个没人敢全信的对话框,形态几乎原地踏步;团队希望五年内推动全要素生产率增长 3%,让自动化真正体现在宏观经济数据里。