私立ずんだもん女学園放送部 podcast 20260925
内容紹介
Introducing Gemini 3.8 Live with Live Avatar、Automating coherent long-form video generation、Apple、Qwen3.5-9BベースのLLMモデル「LensVLM-9B」を公開 NEWS Mac OTAKARA、普通のプリンターやコンビニのコピー機で印刷所で作ったような中綴じ本を作れるブラウザ完結ツールが公開される→めちゃくちゃ助かる人が多そう
出演者
youtube版(スライド付き)
関連リンク
Google DeepMindから、リアルタイムの視覚的プレゼンス(アバター)を備えた「Gemini 3.8 Live with Live Avatar」が発表されました。これは、従来のリアルタイム音声対話モデルに、低遅延なストリーミングビデオ生成技術をネイティブに融合させた、新しいマルチモーダルAI技術です。
新人エンジニアの方に向けて、この技術が持つ主要な特徴と技術的なポイントを分かりやすく解説します。
1. リアルタイムで自然な「マルチモーダル」対話
これまでのAIアシスタントは音声やテキストのみのやり取りが主流でしたが、本機能は「話す、聞く、見る、表情を作る」を同時に行います。入力された音声と映像をリアルタイムに処理しながら、正確なリップシンク(唇の動きの同期)や豊かな表情、自然な会話の間(ターンテーキング)を再現し、生身の人間と話しているかのような体験をユーザーに提供します。
2. 非同期ツール実行による「会話を止めない」バックグラウンド処理
エンジニアとして特に注目したい機能が「非同期ツール実行(Asynchronous Tool Calling)」です。 例えば、AIがホテルのチェックイン手続きやデータの取得(ツールの実行)を裏側で行っている間も、画面上のアバターは会話を途切れさせることなくユーザーと対話を続けられます。処理の待ち時間(レイテンシ)が発生しても、ユーザーを退屈させない滑らかなUX(ユーザー体験)をシステム側で簡単に設計できるようになります。
3. 97言語に対応するシームレスな多言語同期
グローバルなサービス展開にも対応しており、97もの言語をサポートしています。会話の途中で突然異なる言語に切り替わっても、映像の品質を落とすことなく、その言語の適切な発音に合わせてリップシンクや表情がシームレスに変化します。
4. 1枚の画像からブランド専用のアバターを作成
多様なプリセットアバターが提供されているだけでなく、開発者は1枚の高品質な参照画像を用意するだけで、そのキャラクターの見た目やブランドの雰囲気を保ったまま、滑らかに動く独自のカスタムアバターを作成できます(※現在はエンタープライズ向けの限定公開)。
5. 安全性を担保する電子透かし「SynthID」
AI生成コンテンツの信頼性を確保するため、セキュリティ面にも配慮されています。生成されるすべての音声および映像出力には、人間の目や耳には感知できない電子透かし「SynthID」が埋め込まれています。これにより、AIが作成したコンテンツであることをシステム的に識別可能にし、なりすましや偽情報の拡散を防ぎます。
まとめ
「Gemini 3.8 Live with Live Avatar」は、裏側の複雑なAPI処理と、フロントエンドのリアルタイムな対話・映像生成を高度に同期させた、まさに「次世代のAIエージェント」を開発するための強力なツールです。Gemini Enterpriseで利用可能となっており、APIドキュメントも公開されているため、未来の対話型アプリケーション開発に向けてぜひチェックしておきたい技術です。
引用元: https://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/
近年、動画生成AIは高品質な映像を即座に生成できるようになりました。しかし、それらを組み合わせて「ストーリーに矛盾のない一本の長尺動画」を作ることは依然として困難です。従来の自動生成システムでは、カットを切り替えるたびにキャラクターの服装や背景が微妙に変わってしまう「意味的ドリフト」や、前半の小さな生成エラーが後半の破綻を招く「カスケード失敗」が頻発し、人間による膨大な手作業での修正が必要でした。
Google Researchはこの課題を解決するため、GeminiやVeoなどの高性能なAIモデルを統制し、複数カットにわたる視覚的一貫性を自律的に維持する「マルチエージェント・フレームワーク」を開発しました。本技術は、長尺動画生成を「全体最適化」と「世界状態(キャラクターや環境の設定)の追跡」のシステム開発問題として捉え、以下の4つのコア技術で解決しています。
-
AI video co-director(協調的な意思決定) 動画全体の方向性を一貫させるため、強化学習の手法である「マルチアームドバンディット(MAB)」アルゴリズムを用いて、新しいストーリー構成の「探索」と、実績のあるクリエイティブ構成の「活用」を最適化します。決定された方針(戦略、構成、映像美)は、絵コンテ・キーフレーム・動画・音声の生成を担当する専門エージェントへ伝達され、最後にマルチモーダルLLMが成果物を評価して次の生成ループにフィードバックします。
-
CANVAS(ビジュアルの持続的メモリ) 登場人物やシーンの設定情報を構造化して記憶する仕組みです。カメラの視点が別の場所に移動した後に元のシーンに戻るような非連続な場面転換でも、衣服のデザインや空間の立体構造を正確に再現し、ビジュアルのブレを防ぎます。
-
A²RD(時間ダイナミクスの制御) 数分に及ぶ長尺動画を場面(セグメント)ごとに生成する自己回帰型アーキテクチャです。動画メモリを参照しながら、ストーリーを新しく展開させる「外挿(エクスプロポレーション)」と、既存のデザインを維持する「内挿(インターポレーション)」を動的に切り替えることで、物語の進行と物理的な整合性を両立させます。
-
VQQA(自動フィードバックによる品質改善) 生成された動画の描画ミス(不要なオブジェクトの混入や設定の矛盾)を自律的に検出し、修正する仕組みです。VLM(視覚言語モデル)が動画に対して自律的に質問を投げ、得られた不備のフィードバック(自然言語)をもとに、テキストプロンプトを自動調整して再生成します。画素を直接いじるのではなく、プロンプトを洗練させる「ブラックボックス最適化」により、自然な修正を実現しています。
成果と展望 本フレームワークは、一貫性を評価する3つの過酷なベンチマーク試験において、従来手法を大きく上回る一貫性を実証しました。この技術は、クリエイターや開発者を「映像の一貫性を保つための泥臭い調整作業」から解放し、本質的なストーリーの創造や演出に集中できる未来をもたらします。
引用元: https://research.google/blog/coherent-long-form-video-generation/
Appleは、Hugging Faceにてオープンソースの新しいビジョンと言語を扱うモデル(VLM)「LensVLM-9B」を公開しました。このモデルは、高い性能で知られるオープンモデル「Qwen3.5-9B」をベースに、Appleが特定のタスク向けにファインチューニング(微調整)を施したものです。
本モデルの最大の特徴は、複数ページにわたる「長大な文書」を処理する際、消費するトークン数を劇的に削減する、画期的なアプローチを採用している点にあります。
従来の課題とLensVLM-9Bの解決アプローチ
一般的なLLMで長大なPDFやドキュメントを読み込ませて質問に答えさせようとする場合、すべてのテキストをトークン(AIが処理する文字や単語の最小単位)に変換して入力する必要があります。これには膨大な計算リソースが必要となり、コストの増加や処理速度の低下、さらにはモデルが一度に処理できる制限(コンテキスト窓)を超えてしまうという課題がありました。
LensVLM-9Bは、テキストをそのまま読み込ませるのではなく、ドキュメント全体を「圧縮された画像」として捉えることで、この問題をスマートに解決しています。具体的な処理の流れは以下の通りです。
-
ページ全体の画像化と圧縮(粗スキャン) 入力された文書の各ページを、約192×252ピクセルという非常に解像度の低いサムネイル画像に変換します。この時の1ページあたりの視覚的な情報(視覚トークン数)は、わずか「約48トークン」にまで圧縮されます。
-
必要なページの特定とツールの呼び出し モデルはまず、この超軽量なサムネイル画像を使って、ドキュメント全体を俯瞰するようにスキャンします。そして、学習済みの専用ツール「
read_page」を呼び出し、ユーザーからの質問に対して「答えが書かれていそうなページ」をピンポイントで特定します。 -
特定ページのみのテキスト化と回答生成(詳細スキャン) 特定したページのみ、非圧縮のオリジナルテキストを取得して詳細に読み込み、最終的な回答を生成します。
この「全体を粗く見てから、必要な場所だけを細かく見る」というアプローチにより、本来なら約8,000トークンを消費する文書であっても、わずか数百トークンに抑えて処理することが可能になりました。
実践と学習に役立つデモの公開
Hugging Face Spaces上では、実際にこのモデルの挙動を試せる「LensVLM-9Bデモ」も公開されています。長いドキュメントをアップロードして質問を投げかけると、モデルがどのように全体をスキャンし、どのページを選択・展開して答えを導き出したのか、その思考プロセスを視覚的に追うことができます。
技術的な仕様としては、生成処理のレンダリングやプロンプト、ツールのフォーマット、そして「貪欲なデコード(Greedy Decoding)」は公式のリファレンス実装に準拠しており、ZeroGPU(Webブラウザ上でGPUを用いた軽量な推論を実行できる環境)向けに最適化され、Hugging FaceのTransformerライブラリに移植されています。
新人エンジニアに向けた学びのポイント
このニュースは、AIシステムを設計する上で非常に貴重な知見を提示してくれています。 実務でAIを活用したアプリケーションを開発する際、APIの利用コスト削減や、動作速度の高速化は避けて通れない重要な課題です。LensVLM-9Bが示す「低コストで全体をインデックス(把握)し、必要な時にだけ詳細にアクセスする」というアプローチは、RAG(検索拡張生成)などのシステムを構築する上での設計思想としても大いに参考になります。
まずは公開されているデモを触りながら、最先端のモデルがどのように効率化を実現しているのかを体感してみることをおすすめします。
引用元: https://www.macotakara.jp/news/entry-51882.html
ブラウザ完結で利用できる個人開発ツール「コピー本メーカー」が公開され、SNSで大きな話題を呼んでいます。このツールは、家庭用プリンターやコンビニのコピー機を使って、印刷所で作成したような高品質な「中綴じ本(コピー本)」を作るための面付けデータを簡単に作成できるWebアプリです。
従来、コピー本作成におけるページの並べ替え(面付け)や、印刷時のズレ、余白の調整は非常に手間がかかる作業でした。本ツールは、原稿を縮小することなくトンボ通りに断裁すれば余白なしの正寸本になるよう自動で面付けし、両面印刷のズレを吸収する補正機能も備えています。
ユーザーからは「コピ本界の救世主」と絶賛されており、手軽に高クオリティな本が作れると注目されています。ユーザーの具体的な課題を技術でスマートに解決した、新人エンジニアにとっても非常に参考になる個人開発の好例です。
引用元: https://togetter.com/li/2749852
VOICEVOX:ずんだもん