株式会社ずんだもん技術室AI放送局

AIやテクノロジーのトレンドを届けるPodcast。平日毎朝6時配信。朝の通勤時間や支度中に情報キャッチアップとして聞いてほしいのだ。

私立ずんだもん女学園放送部 podcast 20261002

2026年10月02日

MP3ファイルをダウンロード

内容紹介

Introducing Clef: our open-source decision models, and new RL fine-tuning platform、Cut your AI spend with AI Gateways Auto Router、AI Search is now generally available

出演者

お嬢様ずんだもん
お嬢様ずんだもん

youtube版(スライド付き)

関連リンク

Cloudflareは、エージェントのワークフローにおいて高速かつ安価に構造化された決定を下すためのオープンソースの意思決定モデル「Clef」および「Clef-flash」を発表しました。従来の非決定的でオープンエンドな大規模言語モデル(LLM)とは異なり、決定モデルは入力に対して確率を含んだ構造化出力を一貫して高速に返し、人間の介在なしにエージェントがプログラムで判断やルーティングを行えるようにします。

Clefシリーズは、ベースモデルにQwenを採用し、決定モデルのユースケースに特化して事後学習されています。従来のテキストをトークン単位で逐次生成する自己回帰型とは異なり、プレフィル(事前入力)パスを通した後に有効なスキーマ選択肢を並列スコアリングする非自己回帰アプローチをとることで、従来のLLMや他の決定モデルと比較して圧倒的な低レイテンシを実現しています。また、テキスト分類のみに対応する類似モデル(Jevなど)とは異なり、Clefはビジョンエンコーダを搭載しているため画像入力にも対応しており、64kという大きなコンテキストウィンドウを備えている点も特徴です。

モデルのラインナップとしては、より高精度な「Clef」(Qwen3.8-27Bベース)と、レイテンシクリティカルな処理に最適な超高速の「Clef-flash」(Qwen3.5-9Bベース)の2種類が提供されています。これらはCloudflareのWorkers AI上でホストされており、エッジGPUを活用することでネットワークレイテンシを最小限に抑え、エージェントのホットパスに組み込みやすくなっています。APIは既存の決定モデルと互換性があり、開発者は容易に移行することができます。

さらに、Cloudflareはモデルの重みをApache 2.0ライセンスのもとでHugging Faceに完全オープンソースとして公開しており、ローカル環境での実行や実験が可能です。加えて、カスタムワークロードに合わせてClefをチューニングするための強化学習(RL)基盤およびファインチューニングサービスも発表されました。AI Gateway、Workers AI、ContainersなどのCloudflareプラットフォームのプリミティブを組み合わせることで、データの収集から強化学習によるモデルの重み更新、Workers AIへの再デプロイまでをシームレスに行える仕組みを提供し、エージェント開発のさらなる効率化を支援します。

引用元: https://blog.cloudflare.com/clef-decision-models/

Cloudflareは、AI Gatewayの機能として、リクエストごとに最適なモデルを自動で割り当ててコストを削減する「Auto Router」のパブリックベータ版を発表しました。AIの導入が進むにつれ、ユーザーがすべてのタスクで過剰な性能を持つ最先端モデルを手動で選択してしまい、トークンコストが膨らむ課題があります。Auto Routerを利用するには、モデルにcloudflare/autoを指定するだけでよく、エンドユーザーにモデル選択を意識させることなく、タスクに見合った能力を持つモデルへ自動的にリクエストをルーティングできます。

Auto Routerの仕組みとして、AI Gatewayを通過するリクエストの会話データから直近のメッセージを抽出し、Cloudflareのエッジネットワーク上のWorkers AIで動作するマルチヘッド分類モデルに入力します。この分類器は、コーディングやリサーチなどの14種類のタスクカテゴリを割り当てるとともに、複雑さ、曖昧さ、重要度、コンテキストへの依存度という4つの次元で1から5段階の評価を行います。得られたシグナルと各モデルのベンチマーク結果を組み合わせたスコアリングマトリクスによって最適なモデルを算出し、期待される品質とモデルごとのトークン単価(入力・出力価格)を考慮してコストパフォーマンスを最大化します。

また、長時間の開発セッションやエージェントの利用において、モデルの切り替えによってキャッシュが無効化され、コンテキストを再読み込みするコストが発生する問題にも配慮されています。Auto Routerは、キャッシュの読み書きコストを考慮したスイッチングペナルティを適用し、深い会話のコンテキスト内では同一モデルの維持を優先しつつ、品質向上やトークン削減のメリットが上回る場合にのみ適切な判断を下します。これにより、最先端モデルと同等のタスク遂行能力を維持しながら、コストを大幅に抑制することが可能です。ベータ期間中は無料で利用でき、開発者向けドキュメントから詳細を確認できます。

引用元: https://blog.cloudflare.com/auto-router/

Cloudflareは、同社のインフラ上でフルマネージドなインデックスと検索パイプラインを実現する「AI Search」の一般提供(GA)開始を発表しました。AI Searchは、「Workers AI」「Vectorize」「R2」「Browser Run」などの技術を組み合わせて構築されており、社内ドキュメントの検索からWebサイトの検索エンジンまで、幅広い用途で活用されています。今回の一般提供開始に伴い、2026年11月1日から正式な課金が開始される予定です。

今回のアップデートにおける最大のハイライトは、テキストだけでなくマルチモーダルフォーマットへのサポートが大幅に拡張・強化された点です。従来の画像検索では、画像を一度テキストのキャプションに変換してから検索を行うというナイーブな手法が取られていたため、画像内の細かいディテールや色、テクスチャ、構図などが失われがちでした。しかし、新しいAI Searchでは、キャプションベースの理解を維持しつつ、画像ピクセルを直接埋め込む「ネイティブ画像検索」が新たにサポートされました。

このネイティブ画像検索には、Qwen3-VL-Embeddingモデルなどが活用されています。これにより、テキストのみのクエリモデルを使用している場合でも画像をクエリとして入力すると、自動的にToMarkdownによってテキスト化されて検索が行われます。一方、ネイティブで画像をサポートするモデルであれば、画像そのものが持つ視覚的な特徴量をそのまま同じベクトル空間にマッピングできるため、言葉で正確に表現するのが難しい視覚的特徴や複雑な構図を持つ画像でも高精度に検索できるようになりました。検索効率を落とさないよう、Matryoshka Representation Learning(MRL)が導入されており、ストレージを圧迫せずに高速な検索を維持します。

また、データ処理の制限や機能面も向上しています。テキストファイル(Markdown、HTML、CSV、JSONなど)やPDFファイルのアップロード上限サイズが従来の4 MiBから10 MiBへと引き上げられました。さらに、テキスト抽出ができないスキャン済みのPDFファイルに対しても、新たに「OCR(光学文字認識)」機能が有効化できるようになり、ページごとのテキストを読み取った上でチャンク化・埋め込み処理を行えるようになっています。

料金体系については、予測が容易でシンプルな設計が採用されています。取り込むデータ量(インジェクション)、保存データ量(ストレージ)、実行するクエリ数(クエリ)の3つの軸で課金が行われ、パースやチャンク処理、Workers AIモデルによる埋め込み、キーワードインデックス作成、リランキングなどのプロセスは料金に含まれています。すべてのWorkersプランに対して、月ごとの無料枠(500万インジェクション・トークン、10 GBのストレージ、1,000件のセマンティッククエリ、1,000件のフルテキストクエリ)が用意されており、小規模なプロジェクトであれば無料で運用を始めることが可能です。新人エンジニアにとっても、モダンなRAG(Retrieval-Augmented Generation)システムやAIを活用した検索機能をクラウド上で手軽に構築・運用するための非常に有用なプラットフォームとなっています。

引用元: https://blog.cloudflare.com/ai-search-ga/

VOICEVOX:ずんだもん