株式会社ずんだもん技術室AI放送局 podcast 20261007
内容紹介
Introducing Mistral Large 4、EmbeddingGemma 2: an open, lightweight multimodal embedding model、Advancing computer use with Ironclad、AIは不思議のダンジョンを突破できるのか - AIエージェントに『トルネコの大冒険』を遊ばせてみた
出演者
youtube版(スライド付き)
関連リンク
Mistral AIは、最新のフラッグシップモデルである1兆パラメータ(アクティブパラメータ490億)のネイティブマルチモーダルモデル「Mistral Large 4(開発コード名:le Chonk)」のパブリックプレビューを公開しました。オープンウェイトのオープンソースモデルとしてフロンティアクラスの性能を誇り、米国やヨーロッパで開発されたオープンウェイトモデルを大きく上回る性能を実現しています。モデルの重み(ウェイト)は今月末に公開予定であり、現在はMistral StudioにてAPIのプレビューを試すことができます。
Mistral Large 4の主な特徴として、コーディング、エージェントワークフロー、マルチモーダル理解において卓越した性能を発揮します。サイバーセキュリティ、金融、法律などの重要なエンタープライズ領域において、オープンモデルの中で最先端(ステート・オブ・ザ・アート)の成果を上げており、ビジュアルグラウンディングなどの一部のドメインではクローズドなフロンティアモデルさえ凌駕するとしています。
インフラ面では、ヨーロッパにあるMistral独自のデータセンターにおいて、3,800基のNVIDIA Grace Blackwell GPUを使用してゼロから訓練されました。AIの主権(ソブリンティ)を重視しており、特にサイバーセキュリティの領域では、プロバイダー側の制限によって正当な脆弱性調査やインシデントレスポンスがブロックされるリスクを回避し、組織が自らのポリシーに基づいて高度なセキュリティ運用を自社環境で行うことが可能です。
各領域における詳細な性能は以下の通りです。
-
サイバーセキュリティ: AIモデルが実際のソフトウェアのセキュリティ上の欠陥を見つけて修正する能力を測る「Artificial Analysis Cyber Index」において、グローバルでトップ5にランクインし、中国外で開発されたオープンウェイトモデルを大きく引き離しています。実世界の脆弱性の再現とパッチ適用テストではオープンモデル最高水準のスコアを記録しており、マルウェアの解析、脆弱性の優先順位付け、検出ルールの作成などにおいて実用的な有用性を示しています。
-
エージェントコーディング: ソフトウェアエンジニアリング、リポジトリ理解、複雑なターミナルワークフローに優れており、「DeepSWE v1.1」や「SWE-Atlas-QnA」などで高いスコアを記録しています。人間の専門家によるブラインド評価でも上位に位置し、コーディング品質の高さが証明されています。
-
エージェントワークフローとナレッジワーク: Gmail、Googleスプレッドシート、Slack、Salesforceなどのアプリをまたぐビジネスワークフロー(AutomationBench)で高いスコアを記録し、スプレッドシートやスライド、PDFといったプロフェッショナルな成果物の作成・編集においても、金融や法律のベンチマークで高いパフォーマンスを発揮します。
-
マルチモーダル: 複雑なドキュメント、チャート、自然画像を高度に推論し、衛星画像の解析やエンジニアリング図面の検証といった、正確な知覚が必要とされる産業分野でビジュアルグラウンディングとエージェント機能を組み合わせて活用できます。
-
科学と数学: 物理学、数学、ロジック、化学などの科学的タスクやエージェントコーディングにおいて卓越した能力を発揮し、複雑な化学シミュレーション(Hartree-Fockシミュレーションなど)をワンショットで生成するなどの高度な研究アシスタントとしての能力を備えています。
さらに、モデルの安全性にも注力されており、間接的なプロンプトインジェクションに対する堅牢性や、悪意のあるサイバーセキュリティ関連リクエストに対する適切な拒否率など、オープンモデルのフロンティアに位置しています。訓練手法においては、スケーラブルな強化学習(RL)ライブラリを活用し、単一ターンのチャットから複雑な科学的問題解決、安全性の調整まで、多様なタスクを組み合わせて非同期で効率的なトレーニングを行っています。
今後は月末のモデルウェイトの正式リリースに加え、モデルのアーキテクチャや追加のベンチマーク、ポストトレーニングの手法についての詳細が共有される予定です。
引用元: https://mistral.ai/news/mistral-large-4/
Google DeepMindが発表した「EmbeddingGemma 2」は、テキスト、コード、画像、音声、動画を同一の埋め込み空間にマッピングできる、オンデバイス向けの軽量なマルチモーダル埋め込みモデルです。商用利用可能なApache 2.0ライセンスの下で公開されており、パラメータ数は740万(※記事内文面より軽量なモバイル等のエッジ環境に最適化された規模)で、コンシューマー向けハードウェア上で効率的に動作します。前世代のテキスト中心のモデルから大きく進化し、テキストだけでなくコードの検索性能やマルチモーダルな検索・RAG(検索拡張生成)パイプラインの構築を強力にサポートします。
新人エンジニアが押さえておきたい主な特徴とメリットは以下の通りです。
-
優れたクラス最高の性能とモジュール設計 サブ1B(10億未満)パラメータのマルチモーダル埋め込みモデルとして、MTEB(Massive Text Embedding Benchmark)のコード評価などで優れたスコアを記録しています。また、テキストのみのワークロードでは軽量な構成(必要に応じてビジョンやオーディオのエンコーダを追加するモジュール設計)をとることが可能です。
-
ストレージとメモリの効率化(MRLの活用) Matryoshka Representation Learning(MRL)を採用しており、出力ベクトルを768次元から512、256、128次元へと動的に切り捨てることができます。これにより、ローカルのベクトルデータベースのストレージ容量やメモリ使用量を最大6分の1に削減できます。
-
オンデバイスでのパフォーマンス最適化 量子化を施すことで、例えばGoogle Pixel 11 Proなどのデバイス上で、テキストのみであれば約191MB、フルマルチモーダル構成でも約567MBのアクティブRAMで動作します。プライバシーを保護しながら、オフラインでも高速なクロスモーダル検索を実現可能です。
-
拡張されたコンテキストウィンドウ 8Kトークンのコンテキストウィンドウを備えており、EmbeddingGemma 1の4倍の情報を処理できます。これにより、最長5.5分の音声、29枚の画像、58フレームの動画、あるいはそれらを組み合わせたデータを直接ローカルハードウェア上で処理可能です。
-
豊富なエコシステムとツール連携 Hugging FaceやKaggleからモデルウェイトをダウンロードでき、Google AI Edge(MediaPipeやLiteRT)やtransformers、sentence-transformers、vLLM、Ollama、llama.cppなど、さまざまな開発ツールやフレームワークと連携して即座に利用できます。また、QdrantなどのベクトルデータベースやUnslothによるファインチューニングにも対応しています。
EmbeddingGemma 2は、プライバシーに配慮したオフラインでの検索システムや、軽量なAIエージェント、ローカルでのコードベースインデックス作成などを行いたいエンジニアにとって非常に強力な選択肢となります。
引用元: https://deepmind.google/blog/embeddinggemma-2-an-open-lightweight-multimodal-embedding-model/
この記事では、OpenAIが契約管理プラットフォームを手がけるIronclad社と共同で行った、プロフェッショナルな実務におけるAIエージェントのトレーニングと評価についての取り組みが紹介されています。AIエージェントが専門的なソフトウェアを操作し、複雑なビジネス上の問題を解決する能力を高めることが目的です。
OpenAIは、企業のビジネスルールを理解し、マルチステップのワークフローを実行し、その成果物が要件を満たしているかを検証できるようにモデルを訓練することを目指しています。この研究を加速させるため、専門的なワークフローを深く理解しているIronclad社と提携し、法的・商業的・調達業務にまたがる11の複雑なタスク(秘密保持契約(NDA)のセットアップ、調達承認プロセスの作成、法務条項の更新など)を特定しました。
開発されたプロセスでは、各タスクに対して8から50の評価基準が設けられ、Ironclad社が提供するホスト型ソフトウェア環境上でモデルが練習を行いました。研究者らは、合成トレーニングタスクを作成し、強化学習を用いてモデルが実践とフィードバックを通じて改善できるようにしました。
新しいフロンティアモデルである「GPT-6 Astra」は、Ironclad社のタスクで訓練された最初のモデルとなりました。Max推論設定を使用したAstraと、High推論設定を使用した従来の「GPT-5.6 Sol」を比較した結果、11の研究タスクにおいて、Astraの平均スコアは55.0%となり、GPT-5.6 Solの41.6%を上回りました。また、試行ごとの推定平均時間はSolの37.0分からAstraの19.2分へと約48%短縮され、より少ない時間で多くの要件を満たすことが実証されました。
新人エンジニアの視点として注目すべき点は、単にLLMのテキスト生成能力を高めるだけでなく、実際の業務ソフトウェア(コンピューター操作:Computer Use)をエージェントに正確に操作させ、複数ステップの複雑なワークフローを完遂させるためのアプローチ手法です。ドメイン知識を持つパートナー企業と協力し、具体的な評価基準と安全なテスト環境を用意した上で、強化学習によってモデルの実務適応能力を向上させるという、最先端のAIエージェント開発・評価の具体的なユースケースを学ぶことができます。
引用元: https://openai.com/index/advancing-computer-use-with-ironclad
AIエージェントに名作ローグライクゲーム『トルネコの大冒険』を自動プレイさせる挑戦についてのブログ記事です。著者はSNESエミュレータにHTTP MCP(Model Context Protocol)を実装し、AIが操作を行える環境を構築しました。トークン消費を抑えるため、LLMが直接ボタンを連打するのではなく、セマンティックな操作をアトミックな入力に変換するハーネスを実装しています。また、RAMからプレイヤーの状態や視界マップを直接読み取る仕組みや、攻略サイトの情報をスキルとして読み込ませる工夫が施されました。最初は保守的な挙動や知覚の限界によるミスが多発しましたが、AI自身が死亡するたびにハーネスを自動更新し、禁止事項の追加や状態異常の検知といった再発防止策を講じていきました。モデルの切り替えや装備育成マラソンを経て、134回目の冒険でついに目的の「しあわせの箱」を持ち帰ることに成功しています。
引用元: https://giginet.hateblo.jp/entry/2026/09/22/114642
(株式会社ずんだもんは架空の登場組織です)