- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
教程总纲 · Kev 实战:训练并运行你自己的决策模型
讲什么、怎么学、怎么跳读,一页说清。本书面向动手者:把开源决策模型 kev 装进自己的机器,训练并运行它。
一、这本书讲什么
一句话:教你把 Jev-like 决策模型 kev 从开源仓库变成自己机器上跑着的服务,并训练出属于你的版本。
展开成三句:
- 跑起来——uv sync 安装、kev.serve 启动、TypeSafe 官方 SDK 只改 base_url 直连;API 与 TypeSafe System One 兼容(POST /v1/systemone),Noul/Choice/Score 三种问题原语与 Jev 同构。
- 读懂与拆开——概率从出厂拟合的温度里来,confidence 怎么读、confident errors 怎么盯;指针头为什么非自回归、问题隔离怎么防串题、packed 与 separate 为什么逐位一致。
- 训练与守线——从 checkpoint 起训(官方案例 0.804 提升到 0.904,官方 README 口径)、约 1 美元一次的技能化训练;冻结评测套件与 locked test 只读一次的纪律;对模型边界的诚实声明。
二、全书地图
【阶段一 · 跑起来】 【阶段二 · 读懂与拆开】 【阶段三 · 实验与训练】 【阶段四 · 生产化与边界】 第 00 章 导览 第 04 章 架构拆解 第 06 章 Playground 实验场 第 09 章 部署 第 01 章 协议与兼容 第 05 章 概率与校准 第 07 章 微调实战 第 10 章 评测纪律 第 02 章 四尺寸家族 第 08 章 kev-finetune 技能 第 11 章 诚实边界 第 03 章 本地运行 │ │ │ │ ▼ ▼ ▼ ▼ 装好、调通、选对尺寸 ──▶ 懂概率、懂结构 ──▶ 玩实验、练自有模型 ──▶ 上得去线、守得住底
(文字流程图)克隆仓库 ──▶ uv sync ──▶ kev.serve ──▶ SDK 只改 base_url ──▶ 读懂 confidence ──▶ 拆开指针头与问题隔离 ──▶ Playground 探边界 ──▶ 从 checkpoint 微调 ──▶ 部署上线 ──▶ 冻结评测守护 ──▶ 对边界保持诚实。
三、按需跳读
- 急用型(今晚就要用):0.2 环境自检 → 第 01 章 → 第 03 章 → 第 09 章,一条最短闭环。
- 定制型(要训练自己的模型):第 04 章 → 第 07 章 → 第 08 章;第 02 章的尺寸选型按需插读。
- 较真型(要对数字负责):第 05 章 → 第 10 章 → 第 11 章,配第 06 章的 permute 实验做手感。
- 只想看 kev 与 Jev 差多少:0.1 节的三组官方口径数字 + 第 11 章诚实边界。
- 概念没底:先读《Jev 决策编程》第 02 章《核心心智模型》与第 03 章《三种问题类型》,再回来。
四、章节目录
第 00 章 导览
为什么要有开源的 Jev:托管 API 的成本、数据、锁定三痛点,kev 用 Apache-2.0 权重加本地服务加可微调闭环作答,精度差距官方口径一个点内;全书地图、三条阅读路径、环境自检,以及与《Jev 决策编程》的分工——概念在那本,动手在这本。
第 01 章 协议与兼容
systemone 协议速览:请求/响应结构、三种问题类型的字段、与 Chat Completions 的本质区别——决策不是生成;TypeSafe 官方 SDK 只改 base_url 直连本地 kev.serve;一次请求里混问 Noul/Choice/Score 三种问题,读三种结果字段的差异。
第 02 章 四尺寸家族
0.8B(笔记本/CPU 可跑)、4B(消费级 GPU)、9B(单卡 24GB 级)、27B(数据中心/精度优先)怎么选;Qwen3.5 与 Qwen3.8 两代底座的差异,为什么底座决定 validated context 上限;validated context 怎么读、超限的后果、token 预算怎么估。
第 03 章 本地运行
环境安装:uv sync、Python 版本、CUDA 与 MLX 双后端的选择与 torch 安装注意;kev.serve 启动、健康检查、curl 发第一个 Choice 请求、响应逐字段解读、并发与预热小贴士。
第 04 章 架构拆解
指针头与非自回归:一次前向直接「指」选项,为什么天然快且可校准;LoRA rank-16 适配器加指针头的改造方式;问题隔离的 attention mask 版与逐行前向版两版实现;packed 与 separate 两种推理模式结果逐位一致(官方口径)及其对回归测试的意义。
第 05 章 概率与校准
温度拟合:每个 checkpoint 出厂自带拟合温度,温度从验证集拟合的原理;confidence 的来源与解读——choice 看 top 概率、score 看分布集中度,confidence 高不等于对;confident errors(官方口径 Kev-9B 2.4% 对 Jev 3.7%)与生产 gating 弃权阈值的关系。
第 06 章 Playground 实验场
把官方 Playground 当风洞:permute 选项顺序实验,把官方承认的顺序敏感变成可度量的 top-1 翻转率与概率摆幅;国际象棋 demo 压测——选项多、上下文长、状态复杂三重压力下的极限测试。
第 07 章 微调实战
从 checkpoint 起训而不是从 base 起训:官方口径的同任务 from-base 0.33 对 from-checkpoint 0.84,起点选择的教训;微调数据构造、训练流程与官方案例 0.804 提升到 0.904 的路径拆解。
第 08 章 kev-finetune 技能
用面试式采集把领域问题收集成训练集,kev-finetune 技能跑在 Modal 上,约 1 美元一次训练(官方口径);从提问到自有模型的完整工作流。
第 09 章 部署
从「能跑」到「敢上」:服务化配置、并发与预热、监控与止损;急用型路径的终点站。
第 10 章 评测纪律
冻结评测套件(decision-v7、transfer-v4、transfer-v9)与 locked test 只读一次的纪律;KEV_DATE_FACTS 缓解日期运算短板的做法;微调之后怎么证明没有变坏。
第 11 章 诚实边界
官方诚实声明的逐条落地:MMLU-Pro 等通识基准落后、日期运算弱、选项顺序敏感(permute 实验可验证)、context 超长衰减——每条边界配一个自查方法。
附录
附录 A 术语表;附录 B 命令与环境变量速查;附录 C 练习题。
五、参考来源
- kev 官方仓库 jaredpalmer/kev 及其 README(Apache-2.0;Kev 1.0 于 2026-07-30 发布;精度、微调案例、评测套件、约 1 美元训练成本等数字均为官方 README 口径)
- kev 官方 Playground(packed 与 separate 对比、permute、国际象棋 demo)
- 共享前缀批处理方向的相关研究:Hydragen、DeFT、FIRST(官方 README 的相关工作一节提及)
- 《Jev 决策编程》第 02 章《核心心智模型》、第 03 章《三种问题类型》、第 09 章《评测与校准》
- 《Evals 实战:LLM 评测工程》第 07 章《概率系统评测》
- 《Laya 实战:多语言轻量决策引擎与路由》第 09 章(Jev/Kev/Laya 三向选型)
目录大纲
最新文档
知识宇宙
正在加载知识图谱...