Cloudflare 发布多模态决策模型 Clef-omni,支持音视频原生处理 |#AI资讯# #Cloudflare# #多模态模型#

2026年10月9日,Cloudflare 正式发布了全新的开放权重决策模型 Clef-omni。该模型在原有处理文本和图像能力的基础上,进一步扩展了对音频及全格式视频的深度支持,开发者仅需通过单一的 API 调用即可完成多模态内容的解析与决策。

多模态能力的架构升级

早期的 Clef 模型主要聚焦于文本、图像以及从视频中按时间间隔提取的静态帧。相比之下,Clef-omni实现了对 wav、mp3、mp4 和 webm 等音频与视频格式的原生支持。这一改进显著简化了开发流程,开发者无需再额外部署语音转录或音视频分段等繁琐工具,能够直接通过单模型高效处理多元化的输入需求。

模型性能与应用定位

根据官方技术文档,Clef-omni基于 Qwen3-Omni-30B-A3B-Instruct构建,保留了其核心的逻辑理解能力。该模型的设计初衷是处理结构化决策任务,而非生成常规文本。在性能表现方面,纯文本请求的中位响应时间约为 130 毫秒,图像处理约为 150 毫秒;处理一段时长 21 秒且包含音频的视频,完成评估仅需约 1.5 秒。

价格调整与产品序列优化

伴随新模型的发布,Cloudflare 同时也下调了 Clef-flash的使用价格,从每百万输入 Token 0.09 美元降至 0.038 美元,降幅达 58%左右。此外,其托管版本的上下文窗口从 64k 调整为 24k。通过此次调整,Cloudflare 进一步完善了其模型矩阵的阶梯化定价,旨在满足不同开发者对成本控制与处理性能的多样化需求。