Kev – 开源的 Jev 风格决策模型家族,可自训练、自部署

Al项目 2026-09-28 17:44:53 AI导航网

Kev是什么

Kev是Cognition工程VP Jared Palmer开源的决策模型家族,基于Qwen3.5/Qwen3.8,提供0.8B至27B多档模型。Kev不生成文字,输入状态文本加结构化问题,单次前向直接输出校准概率,支持是/否、选项路由、等级打分三类决策,API兼容TypeSafe System One。

Kev的主要功能

  • 结构化决策:输入一段状态文本加若干结构化问题,一次请求直接输出每个选项的校准概率,永不生成解释性文字。

  • 三类决策原语:支持 noul、choice、score。

  • 批量提问隔离:多个问题共享同一份输入状态,通过注意力掩码互相隔离,一次前向传播同时回答所有问题且互不污染。

  • 本地部署:提供 kev.serve 一行命令起服务,暴露 POST /v1/systemone 端点,兼容 CUDA、ROCm 和 Apple Silicon(MLX)。

  • 低成本微调:支持用自有标注数据基于官方 checkpoint 继续训练,配套 kev-finetune skill 让 coding agent 自动完成数据整理、训练、评估、部署全流程。

  • 自带评估体系:内置冻结评测集,报告准确率、Brier分数、校准误差和可自动化决策比例,且 CI 自动校验发布数字。

Kev的技术原理

  • 指针头把生成变判别:Kev 冻结 Qwen 基座权重,外挂一个 rank-16 LoRA 适配器和指针头。每个候选项的 </opt> 隐藏状态与问题的 <decide> 隐藏状态做打分,过 softmax 得到概率,本质是把大模型的”写作题”改造成”选择题”,跳过逐 token 生成。

  • 块因果注意力实现问题隔离:输入序列组织为”状态 + 多个问题块”,注意力掩码让每个 token 只能读到状态和本问题内部,位置 ID 在每个问题处重新计数,因此一次前向可同时回答多个互不相关的问题,共享状态计算且彼此不泄露信息。在 Qwen3.5/3.8 这类混合 Gated DeltaNet 的模型上,则改为每问题独立成行、复用状态 KV 缓存,隔离更严格。

  • 训练与校准:用交叉熵在正确标签上训练 adapter 和指针头,基座全程冻结;每个 checkpoint 在留出数据上拟合一个温度参数,推理时直接输出校准后概率,且温度不改变排序,只校准置信度数值。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Kev

  • 环境准备:安装 Python 3.12/3.13 和 uv,克隆仓库后执行 uv sync --extra serve 安装依赖。

  • 本地启动服务:运行 KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009 启动模型,首次运行自动下载权重。

  • 发送决策请求:向 POST /v1/systemone 提交 state 文本和 questions,返回各选项的校准概率。

  • Python SDK 调用:用 TypeSafe 官方 SDK 将 base_url 指向本地服务,已有 Jev 应用零改动切换。

  • 浏览器试玩:访问 Hugging Face Space或本地运行 playground,无需安装即可体验。

  • 微调自有数据:整理 JSONL 格式的标注数据,用 uv run python -m kev.train --init_from jaredpalmer/kev-4b ... 基于官方 checkpoint 继续训练。

  • Agent 全自动微调:执行 npx skills add jaredpalmer/kev@kev-finetune 后让 coding agent 完成找问题、造数据、训练、评估、部署全流程,无需本地 GPU。

  • 云端部署:执行 pip install modal && modal deploy kev_serve.py 一键部署 HTTPS 端点,闲置时自动缩容到零不计费。

  • 评估验证:用 uv run python -m kev.benchmark --run <模型> --suite evals/v4/transfer-v4 在冻结评测集上验证效果,先评测再上线。

Kev的核心优势

  • 极低成本:单次前向传播直接输出概率,省去逐 token 生成,H100 上答 6 个问题仅 18ms,自建后零调用费。

  • 训练便宜可复现:官方三档移植训练仅花约 95 美元,个人微调一次约 1 美元,完整账单公开透明。

  • 开源可控:Apache-2.0 协议下权重、训练代码、冻结评测集全部公开,可自训、可审计、无供应商锁定。

  • API 即插即用:完全兼容 TypeSafe System One,已有 Jev 应用改个 base_url 即可零改动切换。

  • 多问题一次搞定:共享输入状态、块因果注意力隔离,一次前向同时回答任意数量问题,互不污染。

Kev的项目地址

  • GitHub仓库:https://github.com/jaredpalmer/kev

Kev的同类竞品对比

对比维度Kev(开源)Jev
性质开源模型家族,Apache-2.0闭源商业 API
架构Qwen3.5/3.8 基座 + LoRA + 指针头未公开(Kev 参考其架构思路复现)
模型档位0.8B / 4B / 9B / 27B 可选单一托管模型
新来源准确率27B 0.848,4B 0.838,9B 0.8520.857(开发集)
校准质量置信错误率 4.0%,5%错误预算下自动化 0.45~0.57置信错误率 3.7%,自动化 0.70
速度H100 上 6 问 18ms,可自建批量推理受 API 网络延迟限制
成本权重免费,自托管零调用费;微调约 $1/次按调用付费
数据隐私完全本地/自有服务器,数据不出境数据经过第三方 API

Kev的应用场景

  • 客服工单路由:一次前向同时判断”转哪个部门、要不要升级人工、客户愤怒等级”,按概率阈值自动分流,低置信转人工。

  • 内容安全审核:对 UGC 文本并行执行”noul 是否违规 + choice 违规类型 + score 严重程度”,高置信自动处置。

  • 金融/信贷初审:判断投诉类型、是否需要人工介入、风险等级,概率分布辅助合规留痕与人工复核优先级排序。

  • 电商商品/意图分类:将用户查询路由到搜索、推荐或售后等下游系统,处理”一个词踩多个类目”的多标签分布问题。

© 版权声明

相关文章