マジカルラブリー☆つむぎのピュアピュアA.I.放送局 podcast 20261005
内容紹介
FLUX 3 Image: Maximum control over every pixel Black Forest Labs、Kolibri Has Landed: A Sovereign Open-Weight Model — Aleph Alpha、Open-sourcing AstaBrief, the fast report-generation model in Asta Ai2、地面に落としたネジをGrokに探してもらったらすぐ見つけてくれた話…画像処理におけるAIは強すぎる
出演者
youtube版(スライド付き)
関連リンク
Black Forest Labsは、マルチモーダルモデル「FLUX 3」の一部として、高度な画像生成・編集機能を持つ最新モデル「FLUX 3 Image」を発表しました。新人エンジニアやAI開発者に向けて、このモデルの主要な特徴とアーキテクチャのポイントをわかりやすく解説します。
FLUX 3 Imageの最大の特徴は、画像内の各要素の位置や構成をピクセル単位、あるいは座標ベースで精密に制御できる「バウンディングボックス(Bounding Box)」機能のネイティブな統合です。従来のテキストから画像を生成する手法(Text-to-Image)では、全体の雰囲気やランダムな配置に頼りがちでしたが、本モデルではキャンバスを0から1000のグリッド座標系([y_min, x_min, y_max, x_max])で捉え、指定したエリアに特定のオブジェクトを正確に配置することが可能です。
具体的な仕組みとして、ユーザーやAIエージェントは、画像全体の描写を行うグローバルキャプションと、各要素のID、座標(Bounding Box)、詳細な説明をまとめたJSON形式の要素テーブル(Element Table)を定義します。これにより、多数のオブジェクトが複雑な関係性を持つシーンや、タイトレイアウト、コラージュ、ポスター、エディトリアルデザインなどの高度な構成を極めて高い精度でレンダリングできます。また、手動ですべてのボックスを描画しなくても、LLM(大規模言語モデル)を活用したエージェント機能により、1行のプロンプトとアスペクト比を指定するだけで最適なレイアウトプランを自動生成させることも可能です。
さらに、画像生成後の「ピクセルパーフェクト編集(Pixel-perfect editing)」機能も大幅に強化されています。一度生成された画像に対して、特定の領域(ボックス)単位で再記述(Re-description)、オブジェクトの置換、あるいは移動を行うことが可能です。編集時に指定していない領域や要素はそのまま完全に維持されるため、複数回にわたる修正や細かい調整を行っても画像全体の整合性が崩れにくいという強力なメリットを持っています。
解像度やパフォーマンスの面でも妥協はなく、ネイティブな2Kおよび4K解像度での出力に対応しており、小さなテクスチャ、顔の表情、文字、微細な色調などのディテールが鮮明に保たれます。これにより、看板のレタリング文字や紙幣・切手の微小なデザインなども高精細に再現できます。
総じて、FLUX 3 Imageは単なる高画質な画像生成AIにとどまらず、エージェントシステムからの利用や、デザインワークフローにおける厳密なレイアウト制御を強力にサポートする実践的なマルチモーダルモデルとなっています。APIや商用ウェイト(Commercial Weights)のライセンスも提供されており、画像生成パイプラインの構築や自動化に携わるエンジニアにとって見逃せない重要プロダクトです。
引用元: https://bfl.ai/models/flux-3-image
ドイツのAleph Alpha社は、オープンウェイトのMoE(Mixture-of-Experts)言語モデル「Kolibri」をApache 2.0ライセンスで公式発表し、Hugging Faceで公開しました。欧州の厳格なプライバシー規制やEU AI法を意識して設計されており、エンタープライズや公共機関などのミッションクリティカルな領域での活用を想定しています。
Kolibriは総パラメータ数が約78Bで、1トークンあたり約3Bがアクティブとして動作する効率的な設計を採用しています。最大100万トークンのコンテキスト長をサポートし、英語とドイツ語のバイリンガル性能に優れています。ドイツ語の事前学習データを全体の21%以上占めるように設計し、独自のトークナイザー「UniBPE」を用いることで、自然な形態素分割と高い圧縮率を実現しています。
開発面では、データ収集から事前学習、ポストトレーニング、評価に至るまでのパイプラインをコード化・自動化する「Model Factory」を構築し、短期間での高速なモデル改良を可能にしました。また、ハルシネーション(嘘の出力)を抑制するため、文脈に基づかない場合に「知らない」と回答する仕組みや、独自開発の「Merlin-Arthurプロトコル」を導入して信頼性を高めています。これにより、数学やコーディング、エージェントタスクなどにおいて、より大きなパラメータ数を持つモデルに匹敵する性能を、低いサービングコストで達成しています。
新人エンジニアにとってのポイントとして、このモデルはvLLMと組み合わせて手軽にデプロイできるよう設計されています。提供されているaleph-alpha-inferenceパッケージをインストールし、専用のパーサを指定することで、推論時に推論思考(Reasoning)やツールコール機能を簡単に有効化できます。大規模なコンテキスト長を処理するための起動オプションも用意されており、オンプレミス環境での効率的な運用や、カスタムモデルの構築における優れた実践例を学ぶことができます。
引用元: https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/
アレン人工知能研究所(Ai2)は、科学研究向けの高速レポート生成モデル「AstaBrief 8B」のオープンソース化を発表しました。AstaBriefは、研究の質問と収集した文献の抜粋から、引用付きのレポートを生成できる8B規模のオープンウェイトモデルです。ベースモデルにはQwen3-8Bを採用し、独自の教師ありファインチューニング(SFT)と直接選好最適化(DPO)を活用して開発されました。
科学的な文献調査では、回答がエビデンスに基づいていることや、結論を勝手に広げないこと、そして最終出力を人間が検証できることが強く求められます。これまでのAstaプラットフォームでは、Claudeを活用したプロプライエタリな「Thinking mode」で詳細なレポート生成を行っていましたが、生成に時間がかかるという課題がありました。そこでAi2は、プロプライエタリモデルと同等の品質を維持しつつ、生成時間とサーバーコストを大幅に削減できる軽量なオープンモデルとしてAstaBriefを開発しました。
AstaBriefは、質問に対してセクションごとに分けて生成するのではなく、1パスで直接完全なレポートを生成するパイプラインを採用しています。これにより、Thinking modeの平均178.5秒に対し、Fast modeでは平均51.1秒と、約3.5倍の高速化を実現しました。
モデルの学習においては、数万件の現実の科学的研究クエリを活用し、品質や関連性、プライバシーでフィルタリングを行いました。SFTデータはClaude 3.5 Sonnetやo3などの複数モデルを使用して4万7千件を作成し、DPOデータは異なるモデル間で生成したレポートをLLMジャッジ(GPT-4.1やDeepSeek-R1)で評価・合意させることで約6千件を作成しました。また、引用密度などのシンプルな統計的フィルタリングを導入することで、モデルの根拠に基づく出力を強化し、科学的な合成において不可欠な引用精度を向上させています。
オープンウェイトとして公開されたことにより、研究機関や企業は自身のインフラストラクチャやファイアウォール内でもAstaBriefを実行可能になりました。Ai2はHugging Faceでのモデルウェイトの公開に加え、独自のPDFからレポートを作成するためのサンプルワークフローもGitHubで公開しており、新人エンジニアにとってもLLMのドメイン特化型アプローチやSFT・DPOの実装手法を学ぶ上で非常に有益な事例となっています。
引用元: https://allenai.org/blog/astabrief
床に落として見えなくなった極小のネジを、X(旧Twitter)のAI「Grok」に写真で見つけてもらったという話題が共有され、マルチモーダルAIの画像認識能力の高さが注目を集めています。投稿者が床を撮影した画像をGrokに読み込ませたところ、見失ったネジの場所を正確に見つけ出すことに成功しました。この投稿を見た他のユーザーからも、「ウォーリーを探すのに使えそう」「プラモデルの飛ばしてしまった部品探しに良さそう」「砂浜からヒスイを見つけたい」といったユニークな応用のアイデアが多数寄せられました。さらに、ChatGPT(GPT)やGeminiといった他の主要なマルチモーダルAIでも同様の画像認識と検索ができることが検証され、日常のちょっとした困りごとを解決する強力なツールとしてAIの進化をクスっと笑いながら実感できるエピソードとなっています。
引用元: https://togetter.com/li/2753759
VOICEVOX:春日部つむぎ