2.2 选牌不报牌:判断题与生成题


2.2 选牌不报牌:判断题与生成题

本节摘要:Jev 深度评测(Flavio Copes)里流传最广的一条使用心法:"你从牌堆里抽几张牌摆出来让 Jev 选,而不是让它自己报出一张牌的名字。"本节把这句话展开成判断题/生成题的分界线:答案空间能否预先枚举。能枚举的是判断题(Jev 的主场)——是非、单选、等级落位;不能枚举的是生成题(LLM 的主场)——起标题、估价格、找根因。由此得到一个极简判定测试:"这个 if 的分支数是有限的吗?"最后盘点四个典型的灰色误用:把开放数值当 Score、把计数当 Noul、把起名当 Choice、把多跳推理当验证。

学习目标

阅读完本节,你应当能够:

  1. 复述"选牌不报牌"并用它分类一个新任务。
  2. 用"if 分支有限"测试快速判断适用性。
  3. 识别四个常见灰色误用并给出正确的拆法。

一、心法的来源与含义

"你从牌堆里抽几张牌摆出来让 Jev 选,而不是让它自己报出一张牌的名字。"
"You pick a card from the deck, you don't ask it to name a card." —— flaviocopes.com/jev

  • 判断题:答案空间可以预先枚举。是/否、A/B/C/D、1~5 级。你把候选摆出来,它挑,还给每个候选一个概率。
  • 生成题:答案空间开放。"帮我写一段道歉邮件""这个 bug 的根因是什么""给这张图起个标题"。

这条心法其实是 Jev 能力边界的自然推论:它的输出被结构约束在你声明的空间里,所以它天然只能做"从给定空间里选"的事。让它"报牌名"(开放式生成),等于让系统一干系统二的活。

二、极简判定测试

判断你自己代码里某个分支能不能换成 Jev,就问一句:

这个 if 的分支数是有限的吗?

判断 分支 结论
该工单紧急吗 2 ✅ Noul
邮件属于哪个队列 4~6 ✅ Choice
内容风险几级 5 ✅ Score
该回用户什么话 ❌ 生成题,用 LLM
这封邮件"值"多少钱 ∞(开放数值) ❌ 别让 Score 背锅

注意分界在答案空间,不在问题措辞:"评估严重程度"里"程度"看似模糊,但只要你能写出 5 个具体等级描述,它就是判断题。

三、四个灰色误用

  1. 把开放数值当 Score。"这条线索值多少美元"——美元金额没有预设刻度,Score 的 210 级接不住。拆法:改成"预算档位"Choice(<1k / 1k10k / >10k),或者分级 + 人工复核。
  2. 把计数当 Noul。"正文超过三段吗"——这是可计算条件,Jev 不做计数(第 10.1 节),代码里 len() 一下就够,还免费。
  3. 把起名当 Choice。"这个函数该叫什么"塞 20 个候选选项——能跑,但你在用枚举模拟生成;真正的生成题交给 LLM。
  4. 把多跳推理当验证。"这份财报的数据是否自洽"需要跨段计算比对——Jev 是系统一,不推理。拆法:可计算的部分代码算(增长率、加总),Jev 只判"措辞是否夸大"这类语义面。

⚠️ 灰色地带的通解:任何"半判断半生成"的任务,先问哪一半是有限的——有限的那半交给 Jev,开放的另一半留给 LLM 或代码。这就是下一节的分层架构。

本节要点回顾

  1. 心法:选牌(判断题)不报牌名(生成题);分界 = 答案空间能否枚举。
  2. 测试if 分支有限 → 可用 Jev。
  3. 灰色误用:开放数值、计数、起名、多跳推理——各有正确的拆法(换类型、改代码、交 LLM)。

知道了什么活给 Jev,还要知道什么活留给 LLM、两者怎么在架构里配合——下一节给出"Jev 管门、LLM 管活"的分层设计。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U