2026 年 10 月 1 日,Cloudflare 在 Workers AI 上正式上架了由自家团队训练的首批模型:决策模型 Clef 与 Clef-flash。这两款模型没有走“大语言模型生成文本”的路子,而是专门回答“是/否、选哪个、打几分”这类结构化判断。用 Cloudflare 的话说,它们想让 AI 在代理工作流里扮演“拍板人”——毫秒级给出可编程决策,而不是慢悠悠地吐出一串推理。
这是继九月中旬 Jev 把“决策模型”概念带火之后,首家云计算大厂下场做开源平替。Clef 全系标配与 Jev 兼容的 System One API,开源权重放在 Hugging Face,托管版定价 0.24 美元/百万 token。本文整合 Cloudflare 官方博客、开发者文档与多方技术报道,从模型原理、延迟与基准、调用方式、图像输入、开源定价到行业争议做一次完整追踪。
发布与定位:Cloudflare 的首个自训模型
Clef 是 Cloudflare Workers AI 团队第一次完全自训并商业发布的模型。同步推出的还有强化学习(RL)微调平台,走“AI Gateway 采集线上流量 + Containers 沙箱执行 RL 训练”的路线,目前开放设计合作伙伴申请。
与两个月前市面上涌现的同类模型不同,Clef 的三板斧非常明确:
- 开源:权重以 Apache 2.0 托管在 Hugging Face,Ollama 已原生支持,开发者可以本地跑;
- 低延迟:Clef-flash 中位延迟 38.8 ms,比 Jev 快约 13 倍,专门放在 Agent 热路径;
- 图像输入:在文本决策模型之外,额外支持最多 4 张图输入,做视觉分类与判断。
什么是决策模型?它和 LLM 不是一回事
大语言模型的本质是“开放式生成”:你问一句,它生成一段文本,过程中还有概率抽样,答案不固定。决策模型则反其道而行:输入是一个“状态”和一组“类型化问题”,输出是每个候选答案的校准概率,结果可以直接被代码消费。
一个典型例子是客服工单分流。把用户留言作为状态,模型会被问到三个结构化问题:
- 是否紧急?(是/否)
- 归哪个团队处理?( billing / technical / sales 三选一)
- 按优先级打分?(1-5 分)
模型返回的是概率分布,比如“紧急概率 0.92,归 technical 团队概率 0.87,优先级 4 分概率 0.65”。系统拿到这些概率立刻路由,不再需要人工把 LLM 的散文答案翻译成动作。
这种“输入状态 + 类型化问题 → 输出概率”的范式,天然适合做 Agent 的护栏、审核、路由和监控。
两兄弟:Clef 27B 与 Clef-flash 9B
Cloudflare 这次直接给出一大一小两个版本,都用 64K 上下文窗口,且 API 完全兼容 Jev 的 System One 格式:
| 版本 | 参数量 | 定位 | 上下文窗口 |
|---|---|---|---|
| Clef | 27B | 高精度决策 | 64K |
| Clef-flash | 9B | 延迟敏感的热路径 | 64K |
官方介绍,Clef 基于 Qwen 系列做了后训练;flash 版则在保持兼容 API 的前提下把模型砍到 9B,通过预填充一次前向传播 + 并行打分的方式,跳过逐 token 生成,直接把延迟压到毫秒级。
延迟与基准:flash 中位延迟 38.8 ms,比 Jev 快约 13 倍
Cloudflare 在 43 项 eval 上跑了对比。关键的延迟数字如下(中位数 / p95,单位 ms):
| 模型 | 中位延迟 | p95 延迟 |
|---|---|---|
| Clef-flash | 38.8 | 122.4 |
| Clef | 209.3 | 238.6 |
| Jev | 524.1 | 536.0 |
也就是说,Clef 中位数比 Jev 快约 2.5 倍;Clef-flash 比 Jev 快约 13 倍。这个差距足以让模型直接塞进 Web 请求的“热路径”,而不只是作为后台异步任务。
在 Jev Decision Index 的 10 项基准中,Clef 自称拿到 7 项第一;综合分 Clef 61.21,Jev 57.91。细分项上,BFCL(case exact)Clef 98.47、Clef-flash 98.76、Jev 95.75;BANKING77 macro-F1 Clef 94.20、Jev 79.74;CLINC150+OOS macro-F1 Clef 97.43、Jev 89.27。
在 Jev 自己的工作流 eval 中,Clef 在发票处理、客服、安全事件三项上超过 Jev,仅在 Agent trace observability 一项略逊。需要注意的是,上述成绩目前主要出自 Cloudflare 自测与自家发布的评估页面,尚未被完全独立的上游榜单复现。
怎么用?三种问题类型、一次最多 64 问
Clef 的 API 与 Jev 的 System One API 对齐,开发者只需换 endpoint 和 model 名称即可迁移。一次请求里可以塞最多 64 个问题,分为三种类型:
- noul:是/否问题,返回“答案为是”的概率;
- choice:多选一,返回最高概率选项、每个选项的概率以及置信度;
- score:按有序量表打分,返回概率加权得分与每个分数档的概率。
下面是一段 Cloudflare 官方文档里的 Workers AI 调用示例:
const response = await env.AI.run("@cf/cloudflare/clef", {
model: "clef",
state: "Checkout has been failing for every customer for the last hour.",
questions: {
urgent: { type: "noul", instructions: "Is this support request urgent?" },
team: {
type: "choice",
instructions: "Which team should handle this request?",
criteria: {
billing: "Payments, invoices, and refunds",
technical: "Outages, errors, and configuration",
sales: "Plans and upgrades"
}
}
}
});
// response.answers.urgent.noul -> 紧急概率
// response.answers.team.choice -> 最高概率团队
这种“状态 + 问题 + 概率”的契约,天然适合和现有的规则引擎、工单系统、风控平台对接。
能看图的决策模型:最多 4 张图输入
Clef 与 Jev 的一个重要差异是支持视觉输入。开发者可以在 state 之外附带最多 4 张图片,让模型做“视觉判断”。官方给出的方向包括:截图内容审核、UI 异常检测、商品分类、票据识别等。
对移动端和 Web 应用来说,这意味着用户上传一张截图,Agent 就能立刻判断“这张图是不是诈骗页面”“这个界面是否出现异常”“这张发票属于哪一类费用”——仍然以结构化概率返回,不需要解析 LLM 的散文。
威胁情报实测:域名分类比 gpt-oss-120b 快一倍
Cloudflare 的威胁情报团队已经把 Clef 投入实测。流程是:给一个域名,Browser Run 负责抓取并渲染网页,Clef 负责判断域名类别。Cloudflare 给出的典型输出是“95% 概率时尚网站、85% 概率电商、<1% 概率钓鱼”。
同样的流程下,Clef 完成抓取+渲染+分类需要 2.2 秒;而使用通用大模型 gpt-oss-120b 需要 4.7 秒,且只返回两个分类。Clef 不仅更快,还多输出了多个维度的概率,这对“漏报/误报”之间做权衡非常有价值。
除了威胁情报,还能做什么?
Cloudflare 在官方文档里列出几类典型场景:
- 客服分流:判断工单是否紧急、归哪个团队,然后自动路由;
- 信任与安全:按自定义策略给内容打分,概率超过阈值就拦截或人工复核;
- Agent 护栏:在 Agent 调用工具前快速检查“这个操作该不该做”;
- 视觉分类:结合图片输入做商品、票据、界面截图的结构化判断。
这些场景的共同点是需要“快、便宜、可编程”的判断,而不是需要模型写诗或推理世界模型。
开源、托管与定价
Clef 与 Clef-flash 的权重都已放到 Hugging Face,许可证为 Apache 2.0。Ollama 也已提供支持,本地跑模型的门槛被显著降低。对企业来说,如果不想自己维护 GPU,可以直接用 Workers AI 托管版,当前定价 0.24 美元/百万 token。
托管版的优势在于 Cloudflare 的全球边缘网络:请求在离用户最近的 GPU 节点上执行,网络往返短,这对 Clef-flash 这种“38 ms 级别”的延迟尤其关键——因为模型本身的推理时间已经和网络延迟处于同一数量级。
RL 微调平台:用自己的流量训练专属 Clef
Cloudflare 同步推出了基于强化学习的微调服务。数据收集端靠 AI Gateway 把线上请求记录下来,训练端在 Containers 沙箱里跑 RL。这种“流量即数据、沙箱即训练环境”的闭环,理论上能让企业用真实业务反馈把 Clef 调成适合自己政策的形态。
目前 RL 微调还是设计合作伙伴阶段,没有公开价格和自助入口,但方向很明确:让 Clef 不止是一个开箱即用的通用模型,而是能被“喂”成企业内部的风险偏好、客服策略或审核尺度。
争议: benchmark 第一,不等于真实可靠
Clef 的高分和低延迟发布后不久,Jev 的创作者 Diogo Almeida 在社交媒体上公开质疑 benchmark 的有效性。他指出:“为 benchmark 优化的模型”与“真正可靠的模型”之间存在关键差异,而这个差异并不会反映在 benchmark 分数里。这番表态把“决策模型”这个新赛道推向了更严肃的审视。
另一方面,Jev 方面也在强调商业化进展:10 月初有消息称四分之一的财富 500 强企业已开始采用 Jev。Cloudflare 则把 Clef 的价值锚定在“开源 + 低延迟 + 图像输入”三个差异化点上。这场“Jev vs Clef”之争,本质上也是闭源先行者与开源跟进者之间常见剧本的又一次上演。
总结:决策模型正在成为 Agent infra 的标配
Clef 的发布让“决策模型”从一个初创公司的概念验证,变成了云计算大厂愿意投入自训模型、开源权重、边缘托管、RL 微调的完整产品矩阵。它的核心卖点不是生成更长的文本,而是让 Agent 在需要“拍板”的环节更快、更便宜、更可编程。
对于开发者来说,Clef 最大的吸引力在于兼容 Jev API、Apache 2.0 开源、托管价低,并且能放进 Workers 脚本里几行代码调用。对于行业观察者来说,需要持续关注的是:Cloudflare 自报的成绩能否在独立第三方评测中得到复现,以及 RL 微调平台落地后的真实效果。
如果 2024-2025 年是“大模型越大越好”的竞赛,那么 2026 年看起来更像是“把 AI 切进具体决策环节”的一年。Clef 是这股趋势里最新的一块拼图。

