保姆级手把手教程:玩转发布即爆火的 Jev,快 200 倍、便宜 400 倍
Jev 小白保姆级教程:从「它是什么」到跑通第一个 AI 决策
AI Agent 时代有个扎心的现实:让大模型干正事之前,一堆「小事」也在烧 token——这条留言该转给谁?
这个操作危险吗?
这单生意紧急吗?
每个判断都要等大模型慢悠悠生成一段话,又慢又贵。
2026 年 9 月 15 日,TypeSafe AI 发布了 Jev,专门把这些「小判断」拿出来单独做:不生成一个字,只吐出带概率的结论,官方宣称比同类大模型快 200 倍、便宜 400 倍,发布当天冲上 Hacker News 1679 分。
这篇教程从「它是什么」讲到「亲手跑通你的第一个 Jev 决策」,分两段走:前半程认识它、跑通第一个决策,只要一个浏览器——官方 Playground 连注册都不用,打开网页点两下就有结果;后半程是把它用起来的进阶操作(注册拿 key、命令行调 API、装进编程 Agent),每一步都是我真实跑过的,截图照着做就行,不需要编程基础。
一、Jev 是什么?
先澄清两个最常见的误解:它不是来挑战 GPT、Claude 的全能模型(它连一段话都不会写);
它也不只是「一个普通分类器」——分类器不会给你校准过的概率,也不能读一次材料并行回答一串独立问题。一句话定义:一个不做聊天、只做判断的 AI 模型。
官网:
https://typesafe.ai/
打开官网就能看到它的定位——「The System One (Public) First · Introducing Jev · Intelligence beyond chat」(超越聊天的智能):

官方给它的名字「System One(系统一)」借自心理学家卡尼曼的《思考,快与慢》:
系统一负责快速判断——有东西飞过来本能地躲开、看一眼表情就知道对方生气了;
系统二负责慢思考——做数学题、分析商业计划、权衡重要决策。
过去几年大模型都在拼命加强「系统二」(理解、推理、生成),TypeSafe 反问了一句:一个 AI 系统里的每一步,都需要这么认真地思考吗?
很多时候程序要的不是一篇文章,而是一个判断——这就是 Jev 出现的理由。当然,「系统一」只是个产品类比,官方并没有宣称复现了人类直觉。
你可以把它理解成一条「智能 if 语句」:传统代码里的 if 是死的,Jev 的 if 会看懂上下文再给你带概率的答案。
比如用户发来「我买的东西一个星期还没到,现在不想要了」——客服系统此刻还不需要模型写回复,只需要先搞清楚:这人是查物流还是想退款?情绪激不激动?要不要转人工?Jev 从开发者给定的选项里选,并告诉你每个答案的概率,程序接着走对应流程。
一句话:大模型管生成内容,Jev 管给出判断。
实际用的时候,它常被放在大模型的「中间层」:大模型编排流程,遇到判断和打分就转给 Jev,拿回结构化结果继续干活——大模型拿到了比自己更专业的判断数据,你顺手还省了 token。
顺带说清开源状态:没开源。
模型权重、训练数据、核心实现都没公开,只能通过云端 API 调用——它是「模型服务」,和 Llama 那种能下载权重自己部署的开源模型不是一回事(想要开源自托管,文末有平替方案)。
二、背后的原理:为什么又快又便宜?
Jev 的玩法是「你给状态 + 问题,它给概率」,问题只有三种类型:
- choice(选择):从你给的选项里挑一个,附上各选项概率——适合分类、路由;
- score(打分):按你给的量表打分——适合紧急度、优先级;
- noul(是非):判断一句话真不真,返回 0~1 的概率——适合风险、意图识别。
它快和便宜的根本原因是不逐字生成文本。大模型的自回归机制是一个 token 接一个 token 往外蹦——这个机制买来了写作、编程和开放式推理的能力;
但如果程序只要一个布尔值或一个选项,完整走一遍文本生成实在太重。
Jev 把输出空间提前锁死,不生成任意文字、直接在候选答案上给概率——它用「放弃自由表达」换来了低延迟、低成本、代码可以直接处理的结果。这是一次刻意的减法。
具体优势五条:
- 快:单次决策 70~500 毫秒(第六章实测 233 毫秒),对浏览器操作、实时审核、Agent 路由这类连续决策,直接决定产品体验;
- 便宜:输入 $0.042/百万 token、输出免费——单次不起眼,但每天几万次、几十万次判断时,成本差距会被无限放大;
- 输出稳定:你给五个选项,它就只在这五个里返回,绝不发明第六个,程序不用再从一段自然语言里抠结论。但注意:格式稳定 ≠ 判断正确——它不会在格式上发挥,却完全可能在合法选项里选错。「不产生自由文本幻觉」解决的是接口问题,不是准确率问题;
- 返回概率:把置信度交给程序,你就能设计分档策略——把握大且低风险的动作自动执行,把握一般的交给更强的大模型复核,把握低的或涉及退款付款这类高风险的,直接转人工;
- 并行提问:读一次材料,同时回答多个互相独立的问题,不用反复传上下文——第一章那单客服咨询,意图、情绪、紧急度、要不要转人工,一次全出。
那这条技术路线到底成不成立?
看它站在哪一层就明白了:GPT 擅长开放式任务;传统分类模型适合「类别长期固定 + 数据充足 + 可以专门训练」的任务;Jev 占的是中间那层——问题由开发者临时定义,输出必须限定在明确的类型和选项里。
这一层以前只能凑合着用大模型,现在终于有人为它单独设计模型了。
三、它为什么突然火了?
过去评一个新模型,看的是会不会写代码、数学多强、推理链多长——Jev 反过来做了减法:主动放弃自由文本生成,只优化「判断、选择、打分」这一件事。
这个反差正好击中了 Agent 的现实困境:你看到 Agent 最后交出一份报告,过程中它其实做了成百上千次选择
——这条搜索结果有用吗?
两份资料是不是在重复?
信息够了吗?该调工具还是开始写?结论有证据支撑吗?每个小判断都调最强的大模型,延迟和成本一层层累积;更气人的是,你只要一个选项,大模型还顺手写一段解释,或者吐一个不合规格的 JSON。
再叠加三件事,热度就爆了:
- 拿数字说话:官方的 WikiRace 演示(从「棒球」词条连到「太阳」),Jev 用 0.419 秒、$0.047 完成;对照组的前沿大模型要 3.7 秒、$3.31。
- 踩中 Agent 痛点:「小事走 Jev、大事走大模型」的分流方案,有实践者称 AI 开销省了约 60%。
- 玩法刷屏:Browser Use 社区做了浏览器 Agent——Jev 负责从网页元素里选该点的按钮和输入框,只有真要填文字时才叫生成模型,一次苏黎世到伦敦的航班搜索只用了 7.1 秒;TypeSafe 自己演示让 Jev 玩《毁灭战士》,输入不是游戏画面,而是血量、敌人位置、弹药数这些整理好的游戏状态,它每秒做出多次动作选择;国内还有直播用它打宝可梦对战、玩杀戮尖塔的。
这些案例看起来千差万别,共同点只有一个:任务边界清楚、候选动作明确、请求频率很高,程序不需要一段漂亮的文字,只需要知道下一步做什么。
四、注册:5 步走完(急着体验的可以先跳过)
嫌注册麻烦的直接跳第六章——Playground 不用注册就能跑决策;等你想拿 API key、查用量了,再回来走这 5 步:
一)打开官网,点右上角 API Console
打开官网 https://typesafe.ai/,点右上角的 API Console,按提示用 Google 账号登录(一路授权同意即可):

二)同意条款
登录后先弹出条款页:① 勾选「I have read and agreed...」,② 点 Continue:

三)填姓名和邮箱
① 填上你的名字和邮箱(职业下拉随便选一个),② 点 Next:

四)创建组织
组织名随意(默认就行),公司规模选 Just me,点 Next:

五)填来源问卷
选一个「你从哪听说我们的」(我选的 HackerNews),点 Submit:

五、认识 Jev:一页说明书 + 一道送分题
问卷提交后进入「Meet Jev」欢迎页,左右两栏把它的特性(结构化输出、并行采样、校准概率)、局限(不擅长 System 2 任务、不是聊天模型)、优势(快 20-200 倍、便宜 40-1000 倍)讲得明明白白,看完点右下角 Enter console:

接下来是官方设计的一道入门测试:「你能和 Jev 聊天吗?」——答案当然是 No,它压根不生成文本:

选完答案揭晓:右边就是 Jev 对这道题的真实输出——「Can you chat with Jev?」的判断结果是 97% false。恭喜,你已经见到了第一个 Jev 决策!点 View in Playground 去它的游乐场:

六、Playground 实操:不用注册,3 分钟跑通第一个决策
全文最重要的一章:Playground 免登录、免注册、免费(官方页脚原话:Free, No Waitlist),打开就能玩。直接访问:
https://thejevai.com/playground
一)选一个现成模板
页面自带 15 个官方模板(病毒帖分析、简历筛选、模型路由、代码审查风险……)。
找到 Support triage(客服分流) 点它——左边的 state 输入框立刻自动填进一封真实语气的客服投诉邮件,右侧就是运行按钮:

二)看懂三个问题
模板自带 3 个问题(3/8 表示最多可加到 8 个),正好对应 Jev 的三种原语:topic 用 choice 判断「客户写的是什么问题」,severity 用 score 判断「多紧急」,escalate 用 noul 判断「要不要立刻转人工」:

三)点 Generate decisions,233 毫秒后见证结果
点运行按钮,Results 区立刻给出三个判断(右上角显示耗时)。
完整结果原文:
{
"topic": {
"type": "choice",
"choice": "billing",
"probabilities": {
"billing": 1,
"feature": 0,
"account": 0,
"bug": 0
},
"confidence": 1
},
"severity": {
"type": "score",
"score": 3,
"legend": {
"0": "routine, no rush",
"1": "should be handled today",
"2": "urgent, customer is frustrated",
"3": "critical, customer is about to churn or dispute"
},
"probabilities": {
"0": 0,
"1": 0,
"2": 0,
"3": 1
},
"confidence": 1
},
"escalate": {
"type": "noul",
"noul": 0.93
}
}
翻译:
这封「连续两个月重复扣费、今天不退就取消还要找银行拒付」的邮件——转给计费组(100% 置信)、紧急度打到最高级 3(客户即将流失/拒付)、93% 概率该立刻转人工。一次请求出三个判断,耗时 233 毫秒,一个字的废话没有。
结果下方就是「4. API request」——你刚才那次点击发出的请求原文,点 Preview JSON 就能看到,接代码时照抄即可:

四)照猫画虎,换成你自己的场景
把 state 里的邮件换成你的评论、工单、简历,问题改改措辞,再点一次 Generate——这就是 Jev 的全部玩法。中文完全没问题,我实测把 state 换成一条中文吐槽评论:

点 Generate,229 毫秒返回:topic 还是 billing(100% 置信)、severity 照样打到最高级 3(「客服三天没人理+威胁卸载」)、90% 该转人工——中文评论,英文定义的问题,判断照常出:

记住:choice 的选项、score 的量表都由你定义,Jev 只负责在里面选和打分。
但真正的难点从来不是接通 API,而是把问题定义清楚。
拿第一章那句话举例:「我买的东西一个星期没到,现在不想要了」
——如果 choice 的选项只有「物流延迟」和「申请退款」,这道题本身就设计错了:物流延迟是原因,申请退款是诉求,两者完全可以同时成立。
模型不会替你修复一套混乱的业务标准
——给它的信息不完整、问题含糊、选项互相重叠,它速度再快也没用。
比较稳妥的落地姿势(老手都这么干):
- 先挑一个范围小、答案清楚的任务;
- 拿一批人工处理过的历史数据,让 Jev 在旁边「陪跑」(只观察、不参与正式决策),看它哪些题稳、置信度和真实正确率匹不匹配;
- 匹配了再上岗,按第二章说的分档策略来:低风险、高频、可撤销的动作(打标签、排序)放开自动化;退款、资金、权限、删数据,保留代码规则 + 人工审批。
玩上瘾了?
页面底部还有 3 个官方交互演示:模拟航班搜索、维基百科链接赛跑(就是官方宣传的那场 WikiRace)、客服分流实战,都能看着 Jev 一步步做决策。
七、进入控制台(注册过的同学)
控制台长这样:左侧导航 Home / Playground / Usage / API Keys / Documentation。日常玩 Playground 不用进控制台(上一章的网址直达),控制台的用处是看用量、建 API key:

建 API key 三步:点左侧 API Keys 进入这个页面 → 点右上 + Create key → 给 key 起个名再点确认(表单就是 step09 图右侧那个面板):

创建成功会弹出这个画面——完整 key 只在这里显示这一次,点 Copy 立刻复制存好(我会顺手打码演示,真实的你自己的 key 千万别截图发给别人):

回到列表,Secret key 一栏从此只显示首尾,丢了就得重建:
备忘:列表里那行
apikey_开头的就是建好的 key(脱敏显示),Status 为 Active 表示生效中。
小提示:Jev 早期版本要「Join Waitlist」排队,等邮件里的 Create your account 链接才能建号;现在已经全面开放(官方页脚写着 Free, No Waitlist),按第四、五章直接注册即可。万一你还碰到 Waitlist 页面,提交邮箱等邮件就行。
八、小白最容易踩的 4 个坑
- 别拿它当 ChatGPT 用。写文章、做研究、聊创意、写 Python,它统统干不了。但它和编程大有关系:Agent 干活时的千百次分流选择正是它的活(怎么把它装进编程 Agent,见第十章)。
- 判断可能出错,哪怕格式永远正确。第三方实测准确率约 67.8%;低置信度的判断要留人工兜底(「格式稳定 ≠ 判断正确」的辨析见第二章)。
- 它有官方认证的短板。算术、日期计算、多步推理、夹杂大量无关信息的任务容易翻车(官方文档自己列的),而且它同样可能被提示词注入攻击——别把它放在无防护的敏感位置。
- 付费量力而行。注册送的免费额度足够玩,付费档 Starter $10 起。
九、进阶:亲手调一次 API(可选)
等你玩明白了想接进自己的程序,才需要 API key(第七章已经建好了;Playground 的「4. API request」区也能直接预览请求 JSON)。
命令行直接写 JSON 很容易栽在引号转义上,Windows 小白用「文件法」最稳,两步搞定(下面每一步都是我真实操作截的图):
一)把请求存成 body.json
新建一个文件夹(比如 jev-demo),用记事本把下面的 JSON 原样粘贴进去,另存为 body.json(保存类型选「所有文件」,编码选 UTF-8):

⚠️ 最容易翻车的就是这三处:文件名带 .json 后缀、保存类型不要停在默认的「文本文档 (*.txt)」(否则会存成 body.json.txt,后面 curl 找不到文件)、编码保持 UTF-8。
{
"model": "jev-latest",
"state": "Hi, we were billed twice for March. Please refund the duplicate today or we will cancel our plan.",
"questions": {
"department": {"type": "choice", "instructions": "Which department should handle this?", "criteria": {"billing": "invoices, payments, refunds", "technical": "bugs, outages, system errors", "other": "everything else"}},
"urgency": {"type": "score", "instructions": "How urgent is this ticket?", "criteria": ["not urgent", "soon", "blocking"]},
"churn_risk": {"type": "noul", "instructions": "Does the user seriously intend to cancel their subscription?"}
}
}

二)在同文件夹打开命令行,跑 curl
在文件资源管理器的地址栏输入 cmd 回车(会在当前文件夹打开命令窗口),粘贴这条命令(Windows 10/11 自带 curl,无需安装;YOUR_API_KEY 换成你自己的):
curl -X POST "https://api.typesafe.ai/v1/systemone" -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d @body.json
回车,不到 1 秒返回(下面是我在自己电脑上真实跑的画面——命令里是我的真实 key,图中已打码,你换成你自己的):

完整响应原文:
{
"model": "jev-1.13.0",
"answers": {
"department": {
"type": "choice",
"choice": "billing",
"confidence": 1.0,
"probabilities": {
"billing": 1.0,
"other": 0.0,
"technical": 0.0
}
},
"urgency": {
"type": "score",
"score": 1.9,
"confidence": 0.86,
"legend": {
"0": "not urgent",
"1": "soon",
"2": "blocking"
},
"probabilities": {
"0": 0.0,
"1": 0.09,
"2": 0.91
}
},
"churn_risk": {
"type": "noul",
"noul": 0.67
}
},
"usage": {
"input_tokens": 407,
"output_tokens": 72
}
}
翻译一下:该转给计费组(100% 置信)、紧急度 1.9 分接近「阻塞」(91% 概率)、真想取消订阅的概率 67%——三个判断一次请求全部返回。
三个实测踩坑提醒:
criteria字段必须放在每个问题的顶层,别按直觉嵌套到类型名下面(422 报错就是这么来的);- 端点是
api.typesafe.ai,别用thejevai.com(那是 Playground 的域名,调 API 会报 Invalid API key); - Windows 命令行里别把 JSON 直接写进命令(引号转义地狱),用
-d @body.json文件法——上面两步就是这么做的。
嫌闭源的话,开源平替 laya(pip install laya)暴露了同样的 /v1/systemone 协议,客户端改个地址就能切换,详见 https://github.com/NandhaKishorM/laya;另外 Vercel AI Gateway 和 Cloudflare 上也能调到 Jev。
十、和编程 Agent 一起用:把 Jev 装进 Codex / ZCode / Cursor / WorkBuddy
这是进阶的第二种玩法,也是目前最主流的用法——第一章说的「中间层」落地的样子:编程 Agent(Codex、ZCode、Cursor、WorkBuddy、豆包……)负责编排,Jev 负责判断和打分。不想碰编程 Agent 的同学可以跳过本章,第六章的 Playground 已经够你把 Jev 用起来。
一)装 Skill(一次就好)
最省事的方式:直接把下面这句话发给你在用的编程 Agent,让它自己装:
帮我安装 TypeSafe 的 Jev skills,仓库地址 https://github.com/typesafe-ai/skills
Claude Code 用户可以用官方命令:
claude plugin marketplace add typesafe-ai/skills
claude plugin install typesafe@typesafe-ai
我实测(Windows,Node 24)直接在终端跑 npx skills add typesafe-ai/skills 也行,过程是交互式的:先问装到哪些 Agent(Universal 的 .agents/skills 目录默认必含,还自动适配 Codex、Cursor 等十几个客户端),再问装到项目还是全局——一路回车用默认就行:

装完的确认画面长这样:三方安全扫描 0 告警(Socket / Snyk / Gen),skill 落地在当前项目的 .agents/skills/typesafe-ai 目录:

二)把 API key 配进环境
Windows 打开终端,执行(key 换成你在第七章创建的那个):
setx TYPESAFE_API_KEY "你的key"
注意 setx 对当前窗口不生效,要新开一个终端,用下面这条 curl 验证连通(YOUR_API_KEY 换成你自己的;-d @body.json 用的就是第九章一)保存的那个请求文件,所以在 jev-demo 文件夹里执行):
curl -X POST https://api.typesafe.ai/v1/systemone -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d @body.json
下面是我在自己电脑上真实跑的完整过程——命令里是我的真实 key(图中已打码),setx 写入成功的提示 + curl 的真实返回:

看到 curl 返回那串 JSON(含 usage 字段),就是配置通了。
三)触发使用:任务前加一句话
以后给 Agent 下任务时,前面加一句「请使用 TypeSafe 技能」就能触发。给你一个可以直接套用的任务模板(拿公众号留言分析举例):
请使用 TypeSafe 技能。附件是我公众号后台导出的最近 500 条读者留言,
请逐条判断:留言类型(提问 / 求资源 / 吐槽 / 广告)、情绪是否激烈、是否需要作者亲自回复,
最后汇总出读者最关心的 5 个问题,并挑出 3 条适合公开精选的留言。
Agent 会把「这条留言算什么类型、情绪激不激烈、要不要亲自回」这类批量判断交给 Jev 打分,再基于结果写汇总报告——同样的活交给纯大模型,要么判断口径飘忽,要么 token 烧得心疼。
一个上手后的直观感受:单次判断看不出它的好,成百条数据的批量打分才是它的主场——越复杂的判断,越能显出它的能力。
写在最后
Jev 真正有意思的地方,不只是把原来交给大模型的判断变便宜了
——它可能让那些「原本因为太贵而根本没做」的判断开始大量发生。
当然,更多判断不会自动带来更好的结果:如果标准本身就是错的,系统只是在更快、更便宜地重复错误。
但这个方向值得盯:未来的软件未必需要一个模型包办所有事——复杂推理交给强模型,内容生成交给生成模型,范围明确的小判断交给 Jev 这类决策模型,再配上代码规则和人工审核。
不必事事都动笔写一篇作文——很多时候,程序要的只是一个够快、带概率、拿来就能用的答案。

一个不聊天、只做判断的 AI:快 200 倍、便宜 400 倍,发布当天冲上 Hacker News 热榜。
本教程带你免注册 3 分钟跑通第一个决策,再到亲手调 API、装进编程 Agent,全程截图实测,零基础照做即可。
浙公网安备 33010602011771号