Jev:让 AI 决定下一步,而不只是写出下一句
Jev 把语义判断变成代码能直接使用的选项、分数和概率。鼠标、路由与 if-else 的比喻能解释它的位置,但选择正确、允许执行和执行成功,是三件不同的事。

Andy Gao 对着 Mac 说“打开备忘录,再新建……”,话还没说完,应用已经打开。这段 9 月 18 日发布的演示,用到了 TypeSafe AI 的 Jev。[1]
最值得追问的不是“它怎么这么快”,而是:它究竟负责了哪一步?
语音需要被转成文字,系统要知道有哪些应用和动作,执行层要把应用打开。Jev 参与的是中间那个判断:根据目前得到的信息,接下来该选什么。它没有独自完成整套电脑操作,也不是靠自己看懂屏幕。
把 Jev 理解成“鼠标”很有启发。生成模型负责写出内容,这类决策模型帮助软件决定往哪里走。但鼠标只是比喻,更准确的位置是鼠标背后的选择器:它给有限的候选项分配概率;能不能点、是否现在点、点完有没有成功,仍然由其他部分负责。
这件事落到代码里,其实很熟悉:if-else。
金额大于限额、文件是否存在、日期有没有过期,这些条件用普通代码判断就很好。难写的是另一类条件:客户是不是在要求退款?这段检索材料是否真的支持答案?刚才失败的工具调用值得重试吗?Jev 要接手的,正是这些需要理解语义、却不需要写一篇解释的分支。
它拿走的,是生成答案之前的那段工作
Jev 是 TypeSafe 的托管决策模型。创始人 Diogo Almeida 的发布串发于北京时间 9 月 16 日凌晨;截至 9 月 20 日,官方文档列出的版本是 Jev 1.13,模型 ID 为 jev-1.13.0。[2][3]
它接收状态 state,再接收由开发者定义的问题和答案类型。状态可以是文本、JSON 对象或文本数组。当前版本不直接接收图片、音频或视频;这些输入要先经过其他组件,变成它能处理的文字或结构化信息。
输出只有三类,分别解决三种常见问题:
- Choice:从有限选项里选。 比如把工单分到“支付、技术、售前、需要人工判断”。返回选项、各选项的概率和一个 confidence 值。
- Score:按明确等级打分。 比如内容与任务的关联程度,从“无关”到“直接解决问题”。它返回等级分布,以及由分布计算出的连续分数,不只是随口报一个整数。
- Noul:判断一个命题成立的概率。 比如“这封邮件明确提出了退款请求吗?”结果在 0 到 1 之间。它没有额外的 confidence 字段;0.5 表示真假两边难分,不是“退款意愿中等”。
多个问题可以共享同一份状态,在一次请求里并行评估。开发者可以把“这段代码适不适合合并”拆成是否触及认证、是否删除测试、是否改变公共接口等小问题,然后用代码合并结果。[4]
这里也要纠正一个容易说过头的对比:大语言模型并非只能生成、不能决策。 分类、工具选择、结构化输出,现有大模型早就在做。Jev 的区别是把这种工作单独做成产品:不绕道生成长文本,接口直接服务于选择、评分和分支。
TypeSafe 把这个类别叫作 System One,把训练方法称为 RLCD,即“校准决策强化学习”。公司描述的目标,是让模型给出的概率更符合实际结果。公开资料尚不足以复现完整训练方法,也没有让人据此独立确认其全部架构细节。可以讨论它提供了什么接口,不能仅凭一个新名字,就断言一条全新的智能路线已经被证明。[2]
“合法答案”与“正确答案”,差了一整个工程系统
设想一个路由器,只允许返回“财务、售后、技术”三个部门。它不会突然返回一个不存在的第四部门,但仍然可能把退款投诉送到技术组。
这就是 Jev 宣传中“不会幻觉”需要加上的边界。TypeSafe 所强调的保证,是输出符合预先定义的类型和候选范围。它消除的是越出格式与选项的错误,不是选项内部的误判。 官方自己也列出了数学、日期、绕弯表述、无关上下文和对抗性输入等弱点。[2][5]

图中区分三件事:类型约束保证“答案在允许范围内”;校准要验证“概率与结果是否相符”;安全执行还需要权限、规则和风险控制。
概率也不能直接读成承诺。假如一批相近条件下的预测都报 0.8,校准良好意味着这批事件大约有八成发生,不代表其中某一次已经获得“八成可靠”的安全许可。
confidence 又是另一回事。官方文档说明,它由返回的概率分布形状计算得来:分布越集中,通常越高。它不是独立的第二位裁判,也不能一概当作准确率。[6]
还要看候选项是否完整。如果系统只给“退款”和“拒绝”两个选项,却漏掉“资料不足,先核对订单”,模型再果断,也可能只是被迫在两个不合适的动作中挑一个。
因此,真正有用的新增选项往往是:暂不执行,补充信息。
把“鼠标”拆开,才知道该把 Jev 装在哪里
一个能够可靠操作软件的系统,至少需要五步:读取状态,限定候选动作,评估候选,检查权限与风险,执行并验证结果。

这是系统设计示意,不是 Jev 自带的完整能力。它主要参与第三步;其余环节需要感知组件、代码、工具和必要的人类确认。
以网页操作为例,可以先从 DOM 或无障碍树中取得按钮名称和状态,只把当前允许点击的按钮交给选择器。返回的按钮 ID 再与白名单核对。页面发生变化后重新取状态,避免点击上一秒还在、下一秒已经移动的对象。
同样的逻辑能把你的 if-else 理解落得更实:确定的条件继续交给代码,模糊的语义条件交给模型;模型输出不能绕过代码里的硬规则。
下面是逻辑示意,不是 Jev SDK 的调用样例,也不是推荐直接照抄的生产阈值:
# threshold 必须来自本业务的标注测试集
if not permission_allows(action):
reject()
elif not state_is_fresh() or evidence_is_missing():
request_review()
elif risk_is_unacceptable():
request_review()
elif not relevance_passes_threshold():
use_slower_path()
else:
execute_once(action)
verify_result()
在这个结构里,Jev 可以帮助估计相关性、意图和某些风险信号,但权限检查、状态版本、幂等控制与执行验证,不该变成一道让模型随意回答的选择题。
已经出现的应用,说明了什么
PR 检查:把一次笼统评审拆成一组小判断。 Paolo Rosson 在 9 月 17 日展示了一个流程:输入 diff,一次请求得到 14 项类型化检查,再由代码决定阻断、转安全评审、做小修或合并。他报告的样本是视频里的 6 个 PR,每个 Jev 调用约 0.00007 美元。[7]
这展示了一种值得试的架构,不足以证明 Jev 可以替代完整代码审查。它看见了什么上下文,是否发现跨文件漏洞,漏报的代价是多少,都不是“六个 PR 很便宜”能回答的。更稳妥的用途,是给确定性扫描、测试和人工评审增加一个廉价的分流层。
论文归类:生成与决策各干自己的活。 Hassan 在 9 月 17 日公布的流程,先用 DeepSeek V4 Flash 总结 1,018 篇论文,再把标题、摘要与 24 个主题交给 Jev 分类。他报告摘要费用为 3.99 美元,分类费用为 0.08 美元,分类端到端延迟中位数为 256 毫秒;同时明确说,替换现有分类前还在做评估。[8]
这里有两层价值:长文理解与压缩由生成模型完成,便宜的选择器处理后续归类。也有两层误差:摘要漏掉关键信息,分类器再强也无法补回来。这些数字是作者报告的单个流程结果,不是通用服务保证。
语音操作:快到抢跑,也可能快到误操作。 Mac 演示很直观。可在它的回复区,9 月 20 日凌晨已经有人问到关键问题:用户说到一半停顿或改口,怎么取消、回滚?[1][9]
打开一个应用通常容易恢复,发出邮件、提交付款、删除文件却不同。由此能得到一个实用设计:允许低风险的准备动作提前进行,但把不可逆的提交留到意图完整、权限检查完成之后。这是从讨论延伸出的设计建议,不是演示已经证明的安全能力。
开源生态里,至少有三条不同路线
Jev 本身在已查阅的官方资料中仍是托管模型,没有公开权重。GitHub 上名字里带 Jev 的项目,可能是在调用它,也可能只模仿接口,不能都算成“开源版 Jev”。
直接读候选分数:先试接口思路
TheoLeeCJ/SemIf 原名 OpenJev。它不要求模型先生成一段 JSON,而是读取现有开放模型对指定答案 token 的分数,得到有限候选分布。代码为 MIT 许可,底座权重另看各自条款。
它适合回答一个原型问题:手头的模型能不能用作语义 if 语句?但候选分数归一化后加起来等于 1,不等于已经完成校准。换候选描述、顺序、量化方式或业务数据,表现都可能变化。
训练决策模型:研究质量能否进一步提高
Mapika/decider 提供训练、评估、推理代码及开放权重;代码与所核查的 2B 权重标注 Apache-2.0。它属于真正做了决策任务训练的路线,9 月 20 日仍有代码更新。项目同时承认英语范围、复杂推理与难例上的限制。[13]
Bespoke Nimble 在 Qwen3.5-9B 上做后训练,并公开了一个 Apache-2.0 标注的权重版本。它不是对 Jev API 的简单封装。不过,作者提示数据域有限,不能把自己的小规模留出集成绩推广到所有任务;截至核查时,GitHub 代码仓库也没有检测到许可证,不能把权重许可自动套到代码上。[13]
这两类项目的研究价值,在于能检查训练和评估过程。至于谁胜过 Jev,仍需要同一测试集、同一判断标准以及可比较的延迟路径,不能拿各家 README 的数字直接排榜。
把扩散模型接成选择器:同一权重,两种用途
Google Gemma 9 月 19 日转发的“DiffusionGemma as Jev”,指向一条不同路线:利用扩散模型的画布,在预留的答案位置上读取候选分布,而不是逐字生成答案。相关 vLLM PR 是 #57250,北京时间 9 月 17 日已创建;截至 9 月 20 日晚间核查,仍未合并。[10]
razorback16/openjev 提供相应服务层。值得探索的是:一套常驻内存的权重,既做文本生成,也做有限选项判断。代价是实验性运行时、模型占用和部署工作,不能理解成安装稳定版 vLLM 就全部可用。
尤其要把它与 githubnext/localjev 分开。后者通过普通聊天接口要求模型生成带概率的 JSON,再整理成 Jev 形状。两者都可能接上类似接口,但“模型写出来的概率”和“从候选位置读出的分数”,不是同一种测量;两者也都不自动等于 Jev 的校准质量。
9 月 20 日的新动向,哪些值得继续看
以下以北京时间计。“今天新建仓库”“今天更新”“今天转发”是三种不同事件。这里选取能回到原帖或代码核查的项目,不以热度推断成熟度。
接入门槛继续降低。 TypeSafe 官方今天转发了 Vercel Developers 的公告:Jev 在 Vercel AI Gateway 的免费活动持续至 9 月 25 日。它是限时活动,不是 Jev 输入永久免费的定价承诺;可用性和活动条件要看实际网关。Vercel、Cloudflare 与 LangChain 的接入都已经有官方资料,分别解决分发或编排,不意味着模型开源。[11][12]
把编码代理收到的工具结果先筛一遍。 今天 09:08 创建的 Astro-Han/jev-harness,探索用 Jev 过滤工具结果再交给编码模型,并提供 A/B 对照框架。可以关注它能否减少无关上下文;不能只看输入 token 下降,还要检查关键证据有没有被删掉。
把决策后端放进机器人仿真。 今天 11:38 创建的 FBddcz/embodied-jev,把本地模型、托管 Jev 和兼容接口接进 MuJoCo 工作台。它的启发是把控制框架与决策后端分开比较。仓库保留失败与超时记录,也明确限制演示结论;仿真中的尝试不是现实机器人安全认证。
把直接读分数与低比特权重结合。 今天 16:15 创建的 NicolaiLassen/open-bonzi-jev,将 SemIf 式读取与 Bonsai 权重结合,探索笔记本上的本地判断。项目自己展示了“很自信但答错”的情况,提醒人们别把候选集内的分数当真值。
给本地选择器加上 MCP 接口。 今天 15:49 创建的 GenericJevMCP-via-DiffusionGemma,把有限选项判断包装成 MCP、CLI 与 HTTP 服务。它明确提示概率未经校准,只在给定候选中归一化。适合试本地工具链,不宜直接接管高后果动作。
这些是当天的新实验,不是四个已经成熟的新基础模型。更明显的变化是组合方式:已有模型,加一种判断接口,再放进编码、工具或控制流程。
十个可以试的场景,以及每个场景的刹车
下面是应用设计建议,不是十项已经得到验证的 Jev 产品能力。筛选标准很简单:候选能否列清楚,错误能否被发现,失败后是否有别的路可走。
1.客服工单分流。 输入用户描述和订单背景,输出意图、相关部门与是否需要升级。模型处理语义,订单状态与退款权限由代码查。误分率、重新转派率,比“处理了多少工单”更重要。
2.大小模型路由。 判断请求适合便宜模型、强模型,还是先查工具。把便宜模型失败后的重试也计入成本;如果节约的单次费用换来了更多失败,路由就没有省钱。
3.RAG 证据筛选。 对检索片段判断相关性、时效性和是否支持具体主张。保留原文与来源定位;高分只能是辅助信号,不能替代引用核对。针对法规、医学或财务材料,漏掉反证尤其危险。
4.编码代理的下一步。 在“读文件、跑测试、补实现、停止并报告”中选择,把长循环拆成可观察的小步。错误日志、文件访问边界和迭代预算必须由程序控制,不能让代理无限重试。
5.PR 风险分流。 判断哪些改动碰到认证、数据迁移或公开接口,给评审者排序。模型低风险不等于批准合并;测试、静态扫描和必要评审继续保留。
6.语音助手的提前准备。 流式转写尚未结束时,先准备搜索或打开应用;发送、支付和删除等提交动作等待明确授权。设计取消路径,并测量误触发率,而不只是响应速度。
7.通知与信息流整理。 把“值得打断”“稍后看”“归档”做成有限选项,用用户真实反馈调整。保留重要联系人的硬规则和最近归档入口,避免安静变成漏消息。
8.内容发布前的检查。 将缺来源、标题过度承诺、正文与图片不一致等拆成独立判断。事实核查仍要访问证据;模型不能凭文章读起来顺畅,就宣布它准确。
9.游戏 NPC 与仿真代理。 慢模型定目标,快选择器从当前合法动作中选一步,游戏引擎负责碰撞、资源和冷却。先在仿真里测失败,不能把低延迟演示外推为现实控制可靠性。
10.运营与风控的复核队列。 将日志、报障或异常描述按原因和紧急程度排序,帮助人先看哪些。金额计算、账户权限、交易执行与最终审批留在确定性流程中。对影响用户权益的判断,必须有人工复核与申诉路径。
其中更值得先试的是工单分流、材料筛选和低风险路由:结果容易检查,撤销代价也相对低。不要拿自动付款、删生产数据库或拒绝用户权益,作为第一个展示速度的场景。
算清一次判断,也算清一次误判
TypeSafe 当前列价是每百万输入 token 0.042 美元,输出免费。若一次请求共消耗 1,000 个输入 token,那么单次模型费用是 0.000042 美元,一百万次约 42 美元。[3]
这只是按输入量计算的费用,不包括前面的语音识别、摘要、检索,后面的重试、执行失败与人工复核。官方报告的 70—500 毫秒也不是所有地区、负载和输入长度下的 SLA。[2]
上线前可以做一个足够小、但完整的实验:
- 从真实业务中选一批能标注的任务,覆盖常见、含糊、错误输入和对抗样本。按客户或来源拆分测试集,避免相似内容泄漏。
- 固定模型版本、问题措辞和候选定义。把规则、普通小模型或现有流程作为基线,不只和最昂贵模型比较。
- 同时记录准确率、危险错误、转人工比例、端到端 P95 延迟与每个成功任务的总成本。再检查概率分桶是否符合实际结果。
- 先跑影子模式:模型给建议,原流程照常执行。比较两者差异后,只让低风险且有回滚的分支小比例上线。
- 权重、量化、提示或候选集变更后重测。给超时、服务不可用和低把握结果留出回退路径。
Jev 有意思的地方,不在于它取代了 if-else,而在于它给某些以前写不出来的条件,提供了一种可调用的近似判断。一个软件是否因此更好,要看它错的时候会发生什么。
检查下一个演示时,除了看它点得有多快,也看它有没有一条清楚的“不点”路径。
来源与核查口径
资料截止北京时间 2026 年 9 月 20 日晚间。性能数字按官方或演示作者归因,不代表独立复测。当天项目按 GitHub 创建时间换算为北京时间;代码更新不等于首次发布。X 动态为可核验公开帖与讨论的精选,不声称覆盖全站所有相关内容。
- Andy Gao:Mac 语音操作演示
- TypeSafe:Jev 发布说明;Diogo Almeida 发布串
- TypeSafe:当前模型、价格与输入范围
- TypeSafe:API 与类型定义
- Jev 1.13:已知能力边界
- TypeSafe:confidence 与概率
- Paolo Rosson:PR 检查流程
- Hassan:论文摘要与归类流程
- 语音中途改口与回滚的讨论
- Google Gemma:DiffusionGemma as Jev;Matt Mastracci:比较测试及其范围
- TypeSafe 9 月 20 日转发的 Vercel 免费活动;Vercel 模型页
- Cloudflare 接入文档;LangChain 集成文档
- Bespoke Nimble 权重与模型卡;Decider 2B 权重
- 研究线索:新智元原始报道;其引用的 TestingCatalog 原帖。技术结论以官方文档与项目资料核对,项目仓库已在对应段落链接。
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment