Fujigo
約 4 分で読めます

Alaya-EVOKE: 外部メモリを持つインタラクティブワールドモデル

Fujigo Software Solutions

MC Holding(日本)のメンバー

Alaya-EVOKE: 外部メモリを持つインタラクティブワールドモデル

インタラクティブワールドモデルの画期的進歩

Alaya-EVOKEは2026年8月14日、HuggingFaceで107アップボットを獲得してトレンド1位となり、インタラクティブワールドモデル分野における重要な進歩をマークしました。この研究は、以前のモデルが常に直面してきた2つの核心的課題、つまり限られたメモリと高いレイテンシを解決します。

現在のワールドモデルが直面する問題

現代のインタラクティブワールドモデルは、矛盾する3つの要件を満たす必要があります:永続的メモリ(persistent memory)、リアルタイムインタラクション(responsive interaction)、そして長期的生成(long-horizon generation)。これらの要件は、モデルに対して相反する要求を課します。

denoiser contextまたはkey-value cacheで履歴を維持すると、コストが徐々に増加し、セッション長と保持されるメモリの間のトレードオフを強制します。一方、低レイテンシインタラクションは少数ステップ生成に依存していますが、その能力はteacher modelによって制限されています。これは、EVOKE以前にはどの解決策も根本的に解決できなかったパラドックスです。

EVOKEの画期的アーキテクチャ

EVOKEは、永続的ワールド状態を外部化し、長期的インタラクティブ生成用にteacherを再設計することで、両方の制限を解決します。シーンジオメトリはカメラでインデックスされた外部ワールド状態バンクで維持され、そこからビュー関連情報のみが取得され、セッションが成長するにつれてdenoiser contextが制限されたままになります。

teacherを固定ジェネレーターとして扱うのではなく、EVOKEは長期的監督用に設計されています。そのsparse attentionは、チャンク単位のグループ化、選択された遠いフレームの取得、およびlinear-attention global stateを組み合わせ、メモリと計算の線形成長を実現しながら、長期的な監督を可能にします。

印象的な結果

制限されたcontextと再帰的外部メモリにより、EVOKEはオープンエンドで継続的に進化する生成をサポートします。384×640の解像度で1台のH200 GPUで、1.5秒の各チャンクが2.11秒で生成されます - インタラクティブワールドモデルとして印象的な速度です。

3ステップワールドモデルとして、EVOKEはWBenchで最先端のパフォーマンスを達成し、VBench-LongとVBench-2.0でも競争力を維持しています。self-forced rolloutsの下で適用されるdistribution-matching objectiveは、classifier-free guidanceを使用しない3ステップstudentに両方の能力を転送し、long-term driftへの耐性を向上させながら、responsive conditioningを保持します。

実用的な応用

このアーキテクチャは多くの興味深い応用を開きます:

ロボティクスと自律システム: EVOKEはロボットトレーニング用のシミュレーション環境の作成に使用でき、ロボットはcontext windowによって制限されることなく、継続的に仮想世界と対話できます。

ゲームとVR: 低レイテンシでオープンエンドコンテンツを生成する能力により、EVOKEはゲームとバーチャルリアリティのプロシージャルコンテンツ生成に理想的な候補となります。

ビデオ生成: 外部メモリアーキテクチャにより、以前の方法よりも大幅に長いビデオを生成でき、同時に一貫性と応答性を維持できます。

なぜこのペーパーがトレンドなのか?

このペーパーが注目を集めた理由は、AIコミュニティが長年取り組んできた根本的な問題を解決したからです:計算コストの爆発なしに状態を継続的に維持できるワールドモデルをどのように作成するか。カメラインデックス付き検索を持つ外部メモリバンクという方法は、シンプルだが効果的なアイデアであり、モデルが以前よりもはるかに長いシナリオにスケールすることを可能にします。

さらに、高品質を維持しながら3ステップ生成(わずか3ステップのdenoising)を達成したことは重要な成果です。これは推論時間を大幅に削減し、リアルタイムアプリケーションにとって重要な要素です。

著者とソース

ペーパーはAlayaLabのYuanyang Yin、Gongxuan Wang、Yifan Zhan、Chuanhao Li、Kaipeng Zhang、Feng Zhaoによって書かれました。コードとモデルはHuggingFaceのAlayaLab/Evokeで公開されています。

完全なペーパーはarXiv:2608.13546で読むことができます。

シェア