マジカルラブリー☆つむぎのピュアピュアA.I.放送局 podcast 20260824
内容紹介
RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる、【2026年8月版】ELI5とは?Claude CodeからELI5を使ってみた。難しい話を図で理解しよう!、「Claude Code×GPT」自律ループが凄すぎ、仕事が“3つ”に減る5ステップ、7月にオーストラリアで発生した大規模通信障害の仕組みが判明したが、ITエンジニアが怖くて泣いてしまう内容だった「時刻が正確に合わなかったのか…」
出演者
youtube版(スライド付き)
関連リンク
本記事は、コンシューマ向けGPUとホストRAMを連携させて巨大なMixture-of-Experts(MoE)モデルを動かす推論エンジン「FreeToken(バージョン0.1.2)」を、RTX 5090(VRAM 32GB)とRAM 128GBの環境で実機検証した技術レポートです。
FreeTokenは、モデルの重みをすべてVRAMへ載せず、MoEのexpert(専門家ネットワーク)をホストRAMに配置したうえで、よく使われるexpertだけをGPU上のLRUキャッシュへ動的にロードして推論を行うシステムです。PCIe経由の転送コストが発生するため、VRAMに収まるモデルではvLLMやllama.cppの方が高速ですが、VRAMを超える巨大モデルを動かせる点に強みがあります。
著者による3モデルの検証結果は以下の通りです。
- Ornith 1.5(35B / 23.5GB):VRAMに収まるためFreeTokenの利点が出ず、vLLMやllama.cppの方が高速でした。
- gpt-oss-120b(120B / 65.2GB):VRAMに収まりませんが、expertの約40.4%をVRAMへ常駐させることで、単発推論で127.1 tok/sという実用的な速度を記録しました。
- Qwen3.5-122B-A10B(122B / 83.5GB):アクティブパラメータ数が多く、ハイブリッド線形アテンション(GDN)の状態キャッシュがVRAMを圧迫したため、GPU常駐率が14.5%にとどまり、単発32.0 tok/sとなりました。
結論として、FreeTokenは既存の推論エンジンの上位互換ではなく、VRAMの容量制限でロードできない巨大MoEモデルをコンシューマ機で実行可能にするためのツールであることが実証されました。特にgpt-oss-120bの検証のように、ハードウェアの制約を超えるアプローチとしてエンジニアにとって非常に参考になる検証結果となっています。
引用元: https://zenn.dev/holy_fox/articles/53b82eed45f956
記事では、Claude Codeの新機能として注目されている「ELI5」の導入方法と活用メリットについて解説されています。ELI5(Explain Like I’m 5)は、「5歳児にもわかるように」をコンセプトに、複雑な技術トピックやプロジェクトの全体像を専門用語を極力避け、大きな図解と少ない文章のHTML Artifact形式で出力してくれる開発者向けのSkillです。新人エンジニアが新しいコードベースに入った際の構造理解や、モジュールの依存関係・データの流れを視覚的に把握するのに最適です。
導入はターミナルからコミュニティマーケットプレイス経由で行えます。まず claude plugin marketplace add anthropics/claude-plugins-community でリポジトリを追加し、claude plugin install eli5@claude-community を実行してインストールします。導入後は claude plugin list で有効化されていることを確認し、必要に応じてセッションを再起動します。
基本的な使い方はシンプルで、Claude Codeのプロンプトで /eli5 LLMの仕組みを教えて のようにコマンドを実行します。プロジェクト内のコードやドキュメントを読み込ませながら実行できるため、対象ファイルを指定すればローカルの実装に即した解説が得られます。なお、確実にSVG図解を出力させたい場合は、「最低3つのSVG図解を入れて、矢印付きのフロー図で見せてほしい」といった具体的な指示をコマンドの後に追記するのがコツです。
ELI5の実体は外部APIや複雑なスクリプトを必要とせず、主に1枚の「SKILL.md」ファイルで構成されており、Claudeの生成能力に対して出力フォーマットを指定しているだけのシンプルな仕組みです。そのため、コードの細かい条件分岐の検証やセキュリティ監査、直接的なコード修正といった正確性が求められるタスクには向いていません。あくまで「知らない技術や巨大なコードベースの全体像を短時間でつかむ理解の入口」として、まずは全体像を捉えた上で、詳細をドキュメントやコードで確認するワークフローで活用するのが効果的です。また、社内コードなどを扱う際は機密情報が含まれないかどうかに注意して利用する必要があります。
引用元: https://note.com/kazu_t/n/n34de0b43f0fa
この記事では、AIコーディングの次世代トレンドとして注目を集める「ループエンジニアリング」の概念と、その実践手法について解説しています。従来のバイブコーディングでは、人間が「次に何をやるか」を判断する外側のループを毎回手動で回していましたが、ループエンジニアリングでは、この作業サイクル自体をAIに自律実行させます。Anthropicが定義するように、AIが自ら仕事の発見、実行、検証、次作業の決定を、停止条件を満たすまで繰り返す仕組みを人間が設計するアプローチです。
AIとの関わり方は、「プロンプトエンジニアリング(どう頼むか)」から「コンテキストエンジニアリング(何を知らせるか)」、「ハーネスエンジニアリング(道具や実行環境の整備)」を経て、現在は「ループエンジニアリング(いつ動かし、どう検証し、いつ止めるか)」へと進化しています。プロンプト自体が不要になるわけではなく、エンジニアが最も時間と知恵を注ぐべきポイントが変化しているのが特徴です。新人エンジニアにとっても、単にコードを書く指示出しスキルだけでなく、AIエージェントが自律的にループを回し続けられるようなシステム全体のワークフローや停止条件を設計する視点が、今後の開発現場において非常に重要になってきます。
引用元: https://www.sbbit.jp/article/cont1/186558
オーストラリアで発生した大規模通信障害の原因は、NTPサーバのハードウェア交換に伴う時刻の約20年(1024週)の巻き戻りでした。GPSの週番号ロールオーバーによるカウンタのオーバーフローが背景にあります。これにより、コアネットワーク機器の時刻が過去のものとなり、サーバ証明書が有効期限外(invalid)と判定され、端末と基地局間の認証に失敗して通信断を引き起こしました。正確な時刻同期と証明書の依存関係の怖さを教訓として残す障害です。
引用元: https://togetter.com/li/2736568
VOICEVOX:春日部つむぎ