Cloudflare 开源决策模型 Clef/Clef-flash:比 Jev 快 13 倍,还能看图

AI最新资讯 2026-10-09 13 0

2026 年 10 月 1 日,Cloudflare 在 Workers AI 上正式上架了由自家团队训练的首批模型:决策模型 Clef 与 Clef-flash。这两款模型没有走“大语言模型生成文本”的路子,而是专门回答“是/否、选哪个、打几分”这类结构化判断。用 Cloudflare 的话说,它们想让 AI 在代理工作流里扮演“拍板人”——毫秒级给出可编程决策,而不是慢悠悠地吐出一串推理。

这是继九月中旬 Jev 把“决策模型”概念带火之后,首家云计算大厂下场做开源平替。Clef 全系标配与 Jev 兼容的 System One API,开源权重放在 Hugging Face,托管版定价 0.24 美元/百万 token。本文整合 Cloudflare 官方博客、开发者文档与多方技术报道,从模型原理、延迟与基准、调用方式、图像输入、开源定价到行业争议做一次完整追踪。

发布与定位:Cloudflare 的首个自训模型

Clef 是 Cloudflare Workers AI 团队第一次完全自训并商业发布的模型。同步推出的还有强化学习(RL)微调平台,走“AI Gateway 采集线上流量 + Containers 沙箱执行 RL 训练”的路线,目前开放设计合作伙伴申请。

与两个月前市面上涌现的同类模型不同,Clef 的三板斧非常明确:

  • 开源:权重以 Apache 2.0 托管在 Hugging Face,Ollama 已原生支持,开发者可以本地跑;
  • 低延迟:Clef-flash 中位延迟 38.8 ms,比 Jev 快约 13 倍,专门放在 Agent 热路径;
  • 图像输入:在文本决策模型之外,额外支持最多 4 张图输入,做视觉分类与判断。
Cloudflare 官方博客发布 Clef 开源决策模型与 RL 微调平台

什么是决策模型?它和 LLM 不是一回事

大语言模型的本质是“开放式生成”:你问一句,它生成一段文本,过程中还有概率抽样,答案不固定。决策模型则反其道而行:输入是一个“状态”和一组“类型化问题”,输出是每个候选答案的校准概率,结果可以直接被代码消费。

一个典型例子是客服工单分流。把用户留言作为状态,模型会被问到三个结构化问题:

  1. 是否紧急?(是/否)
  2. 归哪个团队处理?( billing / technical / sales 三选一)
  3. 按优先级打分?(1-5 分)

模型返回的是概率分布,比如“紧急概率 0.92,归 technical 团队概率 0.87,优先级 4 分概率 0.65”。系统拿到这些概率立刻路由,不再需要人工把 LLM 的散文答案翻译成动作。

这种“输入状态 + 类型化问题 → 输出概率”的范式,天然适合做 Agent 的护栏、审核、路由和监控。

两兄弟:Clef 27B 与 Clef-flash 9B

Cloudflare 这次直接给出一大一小两个版本,都用 64K 上下文窗口,且 API 完全兼容 Jev 的 System One 格式:

版本参数量定位上下文窗口
Clef27B高精度决策64K
Clef-flash9B延迟敏感的热路径64K

官方介绍,Clef 基于 Qwen 系列做了后训练;flash 版则在保持兼容 API 的前提下把模型砍到 9B,通过预填充一次前向传播 + 并行打分的方式,跳过逐 token 生成,直接把延迟压到毫秒级。

延迟与基准:flash 中位延迟 38.8 ms,比 Jev 快约 13 倍

Cloudflare 在 43 项 eval 上跑了对比。关键的延迟数字如下(中位数 / p95,单位 ms):

模型中位延迟p95 延迟
Clef-flash38.8122.4
Clef209.3238.6
Jev524.1536.0

也就是说,Clef 中位数比 Jev 快约 2.5 倍;Clef-flash 比 Jev 快约 13 倍。这个差距足以让模型直接塞进 Web 请求的“热路径”,而不只是作为后台异步任务。

在 Jev Decision Index 的 10 项基准中,Clef 自称拿到 7 项第一;综合分 Clef 61.21,Jev 57.91。细分项上,BFCL(case exact)Clef 98.47、Clef-flash 98.76、Jev 95.75;BANKING77 macro-F1 Clef 94.20、Jev 79.74;CLINC150+OOS macro-F1 Clef 97.43、Jev 89.27。

在 Jev 自己的工作流 eval 中,Clef 在发票处理、客服、安全事件三项上超过 Jev,仅在 Agent trace observability 一项略逊。需要注意的是,上述成绩目前主要出自 Cloudflare 自测与自家发布的评估页面,尚未被完全独立的上游榜单复现。

Jev Decision Index 0.2.1 基准:Clef 与 Clef-flash 在延迟与得分上的位置

怎么用?三种问题类型、一次最多 64 问

Clef 的 API 与 Jev 的 System One API 对齐,开发者只需换 endpoint 和 model 名称即可迁移。一次请求里可以塞最多 64 个问题,分为三种类型:

  • noul:是/否问题,返回“答案为是”的概率;
  • choice:多选一,返回最高概率选项、每个选项的概率以及置信度;
  • score:按有序量表打分,返回概率加权得分与每个分数档的概率。

下面是一段 Cloudflare 官方文档里的 Workers AI 调用示例:

const response = await env.AI.run("@cf/cloudflare/clef", {
  model: "clef",
  state: "Checkout has been failing for every customer for the last hour.",
  questions: {
    urgent: { type: "noul", instructions: "Is this support request urgent?" },
    team: {
      type: "choice",
      instructions: "Which team should handle this request?",
      criteria: {
        billing: "Payments, invoices, and refunds",
        technical: "Outages, errors, and configuration",
        sales: "Plans and upgrades"
      }
    }
  }
});
// response.answers.urgent.noul -> 紧急概率
// response.answers.team.choice -> 最高概率团队

这种“状态 + 问题 + 概率”的契约,天然适合和现有的规则引擎、工单系统、风控平台对接。

能看图的决策模型:最多 4 张图输入

Clef 与 Jev 的一个重要差异是支持视觉输入。开发者可以在 state 之外附带最多 4 张图片,让模型做“视觉判断”。官方给出的方向包括:截图内容审核、UI 异常检测、商品分类、票据识别等。

对移动端和 Web 应用来说,这意味着用户上传一张截图,Agent 就能立刻判断“这张图是不是诈骗页面”“这个界面是否出现异常”“这张发票属于哪一类费用”——仍然以结构化概率返回,不需要解析 LLM 的散文。

威胁情报实测:域名分类比 gpt-oss-120b 快一倍

Cloudflare 的威胁情报团队已经把 Clef 投入实测。流程是:给一个域名,Browser Run 负责抓取并渲染网页,Clef 负责判断域名类别。Cloudflare 给出的典型输出是“95% 概率时尚网站、85% 概率电商、<1% 概率钓鱼”。

同样的流程下,Clef 完成抓取+渲染+分类需要 2.2 秒;而使用通用大模型 gpt-oss-120b 需要 4.7 秒,且只返回两个分类。Clef 不仅更快,还多输出了多个维度的概率,这对“漏报/误报”之间做权衡非常有价值。

除了威胁情报,还能做什么?

Cloudflare 在官方文档里列出几类典型场景:

  • 客服分流:判断工单是否紧急、归哪个团队,然后自动路由;
  • 信任与安全:按自定义策略给内容打分,概率超过阈值就拦截或人工复核;
  • Agent 护栏:在 Agent 调用工具前快速检查“这个操作该不该做”;
  • 视觉分类:结合图片输入做商品、票据、界面截图的结构化判断。

这些场景的共同点是需要“快、便宜、可编程”的判断,而不是需要模型写诗或推理世界模型。

开源、托管与定价

Clef 与 Clef-flash 的权重都已放到 Hugging Face,许可证为 Apache 2.0。Ollama 也已提供支持,本地跑模型的门槛被显著降低。对企业来说,如果不想自己维护 GPU,可以直接用 Workers AI 托管版,当前定价 0.24 美元/百万 token。

托管版的优势在于 Cloudflare 的全球边缘网络:请求在离用户最近的 GPU 节点上执行,网络往返短,这对 Clef-flash 这种“38 ms 级别”的延迟尤其关键——因为模型本身的推理时间已经和网络延迟处于同一数量级。

RL 微调平台:用自己的流量训练专属 Clef

Cloudflare 同步推出了基于强化学习的微调服务。数据收集端靠 AI Gateway 把线上请求记录下来,训练端在 Containers 沙箱里跑 RL。这种“流量即数据、沙箱即训练环境”的闭环,理论上能让企业用真实业务反馈把 Clef 调成适合自己政策的形态。

目前 RL 微调还是设计合作伙伴阶段,没有公开价格和自助入口,但方向很明确:让 Clef 不止是一个开箱即用的通用模型,而是能被“喂”成企业内部的风险偏好、客服策略或审核尺度。

争议: benchmark 第一,不等于真实可靠

Clef 的高分和低延迟发布后不久,Jev 的创作者 Diogo Almeida 在社交媒体上公开质疑 benchmark 的有效性。他指出:“为 benchmark 优化的模型”与“真正可靠的模型”之间存在关键差异,而这个差异并不会反映在 benchmark 分数里。这番表态把“决策模型”这个新赛道推向了更严肃的审视。

另一方面,Jev 方面也在强调商业化进展:10 月初有消息称四分之一的财富 500 强企业已开始采用 Jev。Cloudflare 则把 Clef 的价值锚定在“开源 + 低延迟 + 图像输入”三个差异化点上。这场“Jev vs Clef”之争,本质上也是闭源先行者与开源跟进者之间常见剧本的又一次上演。

总结:决策模型正在成为 Agent infra 的标配

Clef 的发布让“决策模型”从一个初创公司的概念验证,变成了云计算大厂愿意投入自训模型、开源权重、边缘托管、RL 微调的完整产品矩阵。它的核心卖点不是生成更长的文本,而是让 Agent 在需要“拍板”的环节更快、更便宜、更可编程。

对于开发者来说,Clef 最大的吸引力在于兼容 Jev API、Apache 2.0 开源、托管价低,并且能放进 Workers 脚本里几行代码调用。对于行业观察者来说,需要持续关注的是:Cloudflare 自报的成绩能否在独立第三方评测中得到复现,以及 RL 微调平台落地后的真实效果。

如果 2024-2025 年是“大模型越大越好”的竞赛,那么 2026 年看起来更像是“把 AI 切进具体决策环节”的一年。Clef 是这股趋势里最新的一块拼图。

相关文章

Nvidia 押注的 Reflection AI 发布首个开源模型 Beam:501B 稀疏 MoE,主打推理效率
万亿参数的 Le Chonk 来了:Mistral Large 4 发布,月底还要把权重开源
Claude Sonnet 5.5 发布(Anthropic,9月28日):比前代快 30%、价格更低,瞄准 agentic 编码与办公
OpenAI DevDay 2026:Dots 全天候智能体 + GPT-6.1 Sol,agents 主流化再下一城
美国 FTC 首次对「失控 AI 智能体」正式立案调查:OpenAI、Anthropic 都要交材料
Google 发布 Gemini 4 Argon:百万 token 输出、网络安全防守拉满的前沿模型