Jev 使用指南:只做判断、不写字的 AI 模型怎么用、用在哪

Jev 不聊天、不写字,只回答带选项的问题并给出概率和置信度,适合把 Agent 路由、内容分类和风险判断做得更快、更便宜。

日常用的大模型,不管是 ChatGPT、Claude 还是各种写代码的 Agent,核心工作都是「写」——写一段回答、写几行代码、写一篇总结。

TypeSafe AI 推出的第一款模型 Jev 走了另一条路线:它不负责生成内容,只负责在给定选项之间做判断。

它不会陪你聊天,不会写文章,也不会直接写代码。它的用法很简单:你给它一段文字作为背景材料,再给它出几道带固定选项的选择题,它在几百毫秒内交卷,告诉你选哪项、每项的概率是多少,以及它对这个判断有几成把握。

用软件里最基础的概念打个比方:普通的 if 条件判断只能比对死数字(比如订单金额是否大于 100、状态是不是已支付)。一旦遇上需要「理解意思」的事情——这封私信是不是在生气、这条留言算不算广告、屏幕上的这几个按钮到底该点哪一个——死规则就会失效。

Jev 扮演的正是一个带常识的智能 if 分支。流程还是由你的代码或 AI 写好的脚本来控制,它只在需要理解意思的那一步介入,给出一个带把握程度的判断。

放到 Agent 里看更清楚。Agent 在一个循环里干活:大模型决定做什么,工具去执行,再判断结果,一直循环到任务完成。每做一个小决定都要再调一次大模型,所以又慢又贵。Jev 接手的就是这些小决定:下一步点哪个按钮、这条命令危不危险、这个任务交给便宜模型还是强模型;需要推理和写字的部分,还是交给大模型。

Jev 的主要功能特点

  • 在固定选项中做语义判断:给它背景材料和一组候选答案,它会选择最符合内容的一项或多项,适合分类、路由和动作选择。
  • 同时返回概率与置信度:程序不仅能拿到答案,还能根据把握程度决定自动执行、再次观察或转交人工。
  • 专门处理高频小决策:它不生成长文本,把计算集中在“选哪个”上,适合放进 Agent 的观察、判断、执行循环。
  • 能理解自然语言条件:情绪、意图、风险、页面元素和任务难度等难以写成固定规则的条件,可以转成选择题交给模型判断。
  • 方便交给编程 Agent 接入:官方技能会指导 Codex 或 Claude Code 完成安装、API 调用、问题设计和测试,开发者主要负责定义选项与验收规则。

TypeSafe 控制台欢迎页:列出模型的特性、局限和好处,局限里写着不擅长系统 2 任务、不是生成式聊天模型(截图:Flavio Copes)

为什么叫「系统 1」与 Jev

TypeSafe 把它定义为一种全新的模型类别:System One(系统 1)模型。

这个名字来自诺贝尔经济学奖得主丹尼尔·卡尼曼的名著《思考,快与慢》。书里把人类的思考分为两个系统:

  • 系统 1(快思考):不费力气、凭借直觉与本能瞬间做出的判断。比如走在路上看到迎面开来的车下意识闪避,或者一眼看出对方脸上带着怒意。
  • 系统 2(慢思考):调动注意力、按部就班进行的深度推理。比如计算 17 × 24,或者推导一段复杂的业务逻辑。

按 TypeSafe 的划分,推理模型做的是系统 2 的活,Jev 专做系统 1 的活:几百毫秒内给出的快速判断。

至于 Jev 这个名字,源自 19 世纪英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)提出的「杰文斯悖论」:当蒸汽机的效率大幅提升、消耗每吨煤的成本大幅下降时,煤炭的总消耗反而上升了,因为便宜的动力被用到了更多地方。TypeSafe 认为智能判断也会这样:一次判断的成本不到万分之一美元、只要几百毫秒时,软件里就会出现大量以前根本不会去调用模型的判断点。

如何用上 Jev:四步全交给 AI

安装、配置、写调用代码,都交给你的编程 Agent(Codex 或 Claude Code)去做,你只需要四步:

  1. 官网申请加入排队:在官网 typesafe.ai 申请加入 waitlist,基本上申请当天能过。
  2. 让 AI 帮你装 TypeSafe 技能:对 Codex 说「安装 npx skills add typesafe-ai/skills --skill typesafe-ai」。用 Claude Code 的话,也可以让它按官方插件方式装:先 claude plugin marketplace add typesafe-ai/skills,再 claude plugin install typesafe@typesafe-ai。两种方式任选一种。
  3. 建立 API Key:登录操作台 console.typesafe.ai,在 API Keys 页面生成一个密钥。
  4. 开始干活:在提示词里说一句 “use the TypeSafe skill”,然后用大白话提出你的需求。

你只需要提供 API Key,说清楚你想处理什么数据、希望怎么分类,其余的代码编写、格式对接和实际测试全部由 AI 代劳。

TypeSafe 控制台首页:右边的 Quickstart 就是一段让编程 Agent 安装技能的提示词,复制给它就行(截图:Flavio Copes)

一句话交代给 AI:真实演示过程

为了验证「全交给 AI」到底顺不顺畅,我们在一个只放了留言文件 comments.txt(8 条我们写的示例留言,不是真实读者留言)的空目录里启动了 Claude Code,输入了下面这段完整提示词,其余什么也没做:

use the TypeSafe skill。帮我写一个 Python 脚本 triage.py:读取当前目录 comments.txt 里的留言(一行一条),用 Jev 把每条分成:提问、商务合作、广告、夸奖、吐槽、其他;再判断这条需不需要我本人回复;分类置信度低于 0.6 的标成「待人工」。写完用 comments.txt 实际跑一遍,把结果打印成表格。API key 已经在环境变量 TYPESAFE_API_KEY 里。只在当前目录里操作。

Claude Code 按 TypeSafe 技能的指引,用 Python 自带的库写了一个 72 行的 triage.py,自己跑了一遍,打出下面这张表:

# 留言 分类 置信度 本人回复 状态
1 请问这个工具有中文版吗?我按你的步骤装到第三步就报错了。 提问 1.00 要 (0.89) 自动
2 加V领取AI副业教程,日入过千,名额有限! 广告 1.00 不用 (0.05) 自动
3 我们是一家 AI 教育公司,想邀请您做一期合作推广…… 商务合作 1.00 不用 (0.38) 自动
4 写得太好了,收藏了! 夸奖 1.00 不用 (0.06) 自动
5 又是恰饭文,没意思。 吐槽 1.00 不用 (0.09) 自动
6 你上次说的那个模型到底能不能商用? 提问 1.00 要 (0.82) 自动
7 你们这服务真是太棒了,三天都没人回我。 吐槽 1.00 要 (0.58) 自动
8 能不能出一期教程讲讲怎么用 Codex 做自动化? 提问 1.00 不用 (0.41) 自动

跑完之后,它还主动提了建议(原话):

你需要知道的三点:

  • 6 个分类全对,第 7 条那种说反话的吐槽也认出来了。
  • 「待人工」这次一条都没触发:8 条的分类置信度都在 1.00 左右。低于 0.6 标待人工的逻辑已经写在脚本里,只是这批留言都太好认,没用上。
  • 「要不要本人回复」有两条我觉得判得不对:第 3 条是商务合作邀约,只给了 0.38,判成不用回;第 8 条是读者想看某期教程,给了 0.41,也判成不用回。我的建议是:商务合作这类直接在代码里规定「一律要本人回」,不交给模型判断,只改一行。你点头我就改。

这个过程说明了用 Jev 的分工:确定的业务规则写在代码里,模糊的语义理解交给 Jev,整体胶水工作交给编程 Agent。

给想看底层的人:一次请求长什么样

这些代码都会由 AI 替你写,这里只是让你知道它在做什么。一次请求只有两部分:state(给它看的材料)和 questions(要它回答的问题)。下面是一张示例工单(我们写的)实测「交给哪个部门」这一问:

{
  "model": "jev-latest",
  "state": { "ticket": "我昨天下单的蓝牙耳机(订单号 20260915-8831)被扣了两次款,每次 299 元,麻烦尽快把多扣的钱退给我。" },
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "`ticket` 应该交给哪个团队处理?",
      "criteria": {
        "billing": "扣款、退款、发票、优惠券等和钱有关的问题",
        "technical": "App 或网站故障、闪退、无法登录、功能报错",
        "sales": "询价、批量采购、企业合作",
        "other": "以上都不是,或者看不出属于哪类"
      }
    }
  }
}

Jev 返回的结果(实测,节选这一问):

{
  "model": "jev-1.13.0",
  "answers": {
    "department": {
      "type": "choice",
      "choice": "billing",
      "confidence": 1.0,
      "probabilities": {
        "billing": 1.0,
        "technical": 0.0,
        "sales": 0.0,
        "other": 0.0
      }
    }
  }
}

注意两个关键特征:

  1. 不会答出选项之外的东西:Jev 不是一个字一个字地生成 JSON,而是直接给出你定义的那几个选项各自的概率,所以答案不可能超出选项,也不会出现坏掉的格式(官方把这叫「0% 类型错误」)。但这不代表每次都选对,它照样可能判断错。
  2. 一次回答所有问题:所有问题在同一轮计算中并行评估,互相不影响。

三种基础题型

在 Jev 里,所有判断都被归纳为三种基础题型:

是非题(Noul)

询问某个陈述是真还是假。返回一个 0 到 1 之间的概率数值 noul。 接近 1 代表很可能是「是」,接近 0 代表很可能是「否」。