Alaya-EVOKE: Mô hình thế giới tương tác với bộ nhớ ngoài
Fujigo Software Solutions
Thành viên MC Holding (Nhật Bản)

Đột phá trong mô hình thế giới tương tác
Alaya-EVOKE vừa trở thành paper #1 trending trên HuggingFace ngày 14/8/2026 với 107 upvotes, đánh dấu bước tiến quan trọng trong lĩnh vực interactive world models. Nghiên cứu này giải quyết hai thách thức cốt lõi mà các mô hình thế giới trước đây luôn phải đối mặt: bộ nhớ hữu hạn và độ trễ cao.
Vấn đề của các mô hình thế giới hiện tại
Các interactive world models hiện đại cần đáp ứng ba yêu cầu mâu thuẫn nhau: bộ nhớ liên tục (persistent memory), tương tác thời gian thực (responsive interaction), và khả năng tạo nội dung dài hạn (long-horizon generation). Những yêu cầu này đặt ra các đòi hỏi xung đột cho mô hình.
Duy trì lịch sử trong denoiser context hoặc key-value cache gây ra chi phí tăng dần, buộc phải đánh đổi giữa độ dài phiên làm việc và bộ nhớ được giữ lại. Trong khi đó, tương tác độ trễ thấp dựa vào generation ít bước, nhưng khả năng bị giới hạn bởi teacher model. Đây là nghịch lý mà chưa có giải pháp nào trước EVOKE giải quyết triệt để.
Kiến trúc đột phá của EVOKE
EVOKE giải quyết cả hai hạn chế bằng cách externalize persistent world state và redesign teacher cho long-horizon interactive generation. Scene geometry được duy trì trong external world state bank, được index theo camera, từ đó chỉ retrieve thông tin view-relevant, giữ cho denoiser context bounded khi session tăng trưởng.
Thay vì coi teacher như fixed generator, EVOKE thiết kế nó cho long-horizon supervision. Sparse attention của nó kết hợp chunk-wise grouping, retrieval of selected distant frames, và linear-attention global state, tạo ra tăng trưởng tuyến tính về memory và compute trong khi vẫn cho phép supervision over long horizons.
Kết quả ấn tượng
Với bounded context và recurrent external memory, EVOKE hỗ trợ open-ended, continuously evolving generation. Trên một H200 GPU ở độ phân giải 384×640, mỗi chunk 1.5 giây được tạo ra trong 2.11 giây - một tốc độ ấn tượng cho interactive world model.
Là three-step world model, EVOKE đạt state-of-the-art performance trên WBench trong khi vẫn competitive trên VBench-Long và VBench-2.0. Distribution-matching objective, được áp dụng dưới self-forced rollouts, transfer cả hai capabilities cho three-step student không sử dụng classifier-free guidance, cải thiện resistance to long-term drift trong khi vẫn preserving responsive conditioning.
Ứng dụng thực tiễn
Kiến trúc này mở ra nhiều ứng dụng thú vị:
Robotics và autonomous systems: EVOKE có thể được sử dụng để tạo ra các simulation environments cho robot training, nơi robot có thể tương tác với thế giới ảo liên tục mà không bị giới hạn bởi context window.
Gaming và VR: Khả năng tạo nội dung open-ended với low latency làm cho EVOKE trở thành ứng cử viên lý tưởng cho procedural content generation trong game và virtual reality.
Video generation: Kiến trúc external memory cho phép tạo video dài hơn đáng kể so với các phương pháp trước đây, trong khi vẫn duy trì consistency và responsiveness.
Tại sao paper này trending?
Paper này thu hút sự chú ý vì nó giải quyết được vấn đề fundamental mà cộng đồng AI đã vật lộn trong nhiều năm: làm thế nào để tạo ra world models có thể duy trì state liên tục mà không bị bùng nổ computational cost. Phương pháp external memory bank với camera-indexed retrieval là một ý tưởng đơn giản nhưng hiệu quả, cho phép mô hình scale đến các scenarios dài hơn nhiều so với trước đây.
Ngoài ra, việc đạt được three-step generation (chỉ 3 bước denoising) mà vẫn giữ được chất lượng cao là một thành tựu đáng kể, vì nó giảm đáng kể inference time - yếu tố quan trọng cho real-time applications.
Tác giả và nguồn gốc
Paper được viết bởi Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, và Feng Zhao từ AlayaLab. Code và model đã được public trên HuggingFace tại AlayaLab/Evoke.
Bạn có thể đọc paper đầy đủ trên arXiv:2608.13546.