Kev是什么
Kev是Cognition工程VP Jared Palmer开源的决策模型家族,基于Qwen3.5/Qwen3.8,提供0.8B至27B多档模型。Kev不生成文字,输入状态文本加结构化问题,单次前向直接输出校准概率,支持是/否、选项路由、等级打分三类决策,API兼容TypeSafe System One。

Kev的主要功能
结构化决策:输入一段状态文本加若干结构化问题,一次请求直接输出每个选项的校准概率,永不生成解释性文字。
三类决策原语:支持
noul、choice、score。批量提问隔离:多个问题共享同一份输入状态,通过注意力掩码互相隔离,一次前向传播同时回答所有问题且互不污染。
本地部署:提供
kev.serve一行命令起服务,暴露POST /v1/systemone端点,兼容 CUDA、ROCm 和 Apple Silicon(MLX)。低成本微调:支持用自有标注数据基于官方 checkpoint 继续训练,配套
kev-finetuneskill 让 coding agent 自动完成数据整理、训练、评估、部署全流程。自带评估体系:内置冻结评测集,报告准确率、Brier分数、校准误差和可自动化决策比例,且 CI 自动校验发布数字。
Kev的技术原理
指针头把生成变判别:Kev 冻结 Qwen 基座权重,外挂一个 rank-16 LoRA 适配器和指针头。每个候选项的
</opt>隐藏状态与问题的<decide>隐藏状态做打分,过 softmax 得到概率,本质是把大模型的”写作题”改造成”选择题”,跳过逐 token 生成。块因果注意力实现问题隔离:输入序列组织为”状态 + 多个问题块”,注意力掩码让每个 token 只能读到状态和本问题内部,位置 ID 在每个问题处重新计数,因此一次前向可同时回答多个互不相关的问题,共享状态计算且彼此不泄露信息。在 Qwen3.5/3.8 这类混合 Gated DeltaNet 的模型上,则改为每问题独立成行、复用状态 KV 缓存,隔离更严格。
训练与校准:用交叉熵在正确标签上训练 adapter 和指针头,基座全程冻结;每个 checkpoint 在留出数据上拟合一个温度参数,推理时直接输出校准后概率,且温度不改变排序,只校准置信度数值。

微信关注回复“开源”,加入AI开源项目交流群
如何使用Kev
环境准备:安装 Python 3.12/3.13 和 uv,克隆仓库后执行
uv sync --extra serve安装依赖。本地启动服务:运行
KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009启动模型,首次运行自动下载权重。发送决策请求:向
POST /v1/systemone提交 state 文本和 questions,返回各选项的校准概率。Python SDK 调用:用 TypeSafe 官方 SDK 将 base_url 指向本地服务,已有 Jev 应用零改动切换。
浏览器试玩:访问 Hugging Face Space或本地运行 playground,无需安装即可体验。
微调自有数据:整理 JSONL 格式的标注数据,用
uv run python -m kev.train --init_from jaredpalmer/kev-4b ...基于官方 checkpoint 继续训练。Agent 全自动微调:执行
npx skills add jaredpalmer/kev@kev-finetune后让 coding agent 完成找问题、造数据、训练、评估、部署全流程,无需本地 GPU。云端部署:执行
pip install modal && modal deploy kev_serve.py一键部署 HTTPS 端点,闲置时自动缩容到零不计费。评估验证:用
uv run python -m kev.benchmark --run <模型> --suite evals/v4/transfer-v4在冻结评测集上验证效果,先评测再上线。
Kev的核心优势
极低成本:单次前向传播直接输出概率,省去逐 token 生成,H100 上答 6 个问题仅 18ms,自建后零调用费。
训练便宜可复现:官方三档移植训练仅花约 95 美元,个人微调一次约 1 美元,完整账单公开透明。
开源可控:Apache-2.0 协议下权重、训练代码、冻结评测集全部公开,可自训、可审计、无供应商锁定。
API 即插即用:完全兼容 TypeSafe System One,已有 Jev 应用改个 base_url 即可零改动切换。
多问题一次搞定:共享输入状态、块因果注意力隔离,一次前向同时回答任意数量问题,互不污染。
Kev的项目地址
- GitHub仓库:https://github.com/jaredpalmer/kev
Kev的同类竞品对比
| 对比维度 | Kev(开源) | Jev |
|---|---|---|
| 性质 | 开源模型家族,Apache-2.0 | 闭源商业 API |
| 架构 | Qwen3.5/3.8 基座 + LoRA + 指针头 | 未公开(Kev 参考其架构思路复现) |
| 模型档位 | 0.8B / 4B / 9B / 27B 可选 | 单一托管模型 |
| 新来源准确率 | 27B 0.848,4B 0.838,9B 0.852 | 0.857(开发集) |
| 校准质量 | 置信错误率 4.0%,5%错误预算下自动化 0.45~0.57 | 置信错误率 3.7%,自动化 0.70 |
| 速度 | H100 上 6 问 18ms,可自建批量推理 | 受 API 网络延迟限制 |
| 成本 | 权重免费,自托管零调用费;微调约 $1/次 | 按调用付费 |
| 数据隐私 | 完全本地/自有服务器,数据不出境 | 数据经过第三方 API |
Kev的应用场景
客服工单路由:一次前向同时判断”转哪个部门、要不要升级人工、客户愤怒等级”,按概率阈值自动分流,低置信转人工。
内容安全审核:对 UGC 文本并行执行”noul 是否违规 + choice 违规类型 + score 严重程度”,高置信自动处置。
金融/信贷初审:判断投诉类型、是否需要人工介入、风险等级,概率分布辅助合规留痕与人工复核优先级排序。
电商商品/意图分类:将用户查询路由到搜索、推荐或售后等下游系统,处理”一个词踩多个类目”的多标签分布问题。
