Cách đây vài tuần, tại Lisbon, tôi ngồi với một người bạn làm kỹ sư tại vLLM. Anh ấy nói: "Cái bẫy đã giương, chỉ còn chờ con mồi." Tôi nhướng mày. Anh giải thích: con mồi là làn sóng agentic traffic – những tác nhân AI thực hiện nhiều lượt hội thoại, gọi công cụ, tạm dừng rồi tiếp tục. Và cái bẫy, chính là sự thay đổi căn bản trong kiến trúc inference mà cả ngành đang âm thầm chuẩn bị.
Họ nói rằng batch inference đã đủ tốt. Nhưng tôi nhìn thấy vết xe đổ từ những ngày đầu của DeFi Summer: khi lưu lượng tăng đột biến, mọi thứ vỡ vụn. Lần này, agentic traffic đang đặt áp lực lên hệ thống inference tập trung. Và giải pháp – disaggregated serving – không phải là phát minh mới, mà là sự hội tụ của nhiều team độc lập. Tại hội nghị vLLM đầu tiên (tháng 3/2026), Intel, AMD, Prime Intellect, và nhiều tên tuổi khác đều trình bày cùng một hướng: tách prefill và decode thành hai tài nguyên riêng biệt.
Về mặt kỹ thuật, điều này có lý. Prefill là tính toán nặng (compute-bound), decode là băng thông bộ nhớ (memory-bound). Gộp chung trên cùng một GPU gây lãng phí. Khi tách ra, prefill cluster có thể dùng GPU mạnh về tính toán, decode cluster dùng GPU có băng thông cao. Điểm mấu chốt là KV cache – bộ nhớ đệm chứa ngữ cảnh hội thoại – phải được truyền giữa các node qua RDMA. vLLM đã giới thiệu NixlConnector (mặc định từ v0.8) và MORI-IO dành riêng cho AMD. Kết quả: trên 8x AMD MI300X, goodput tăng 2.5 lần so với collocated.
Nhưng đây mới chỉ là thí nghiệm. Meta, LinkedIn, Mistral, Hugging Face – những production user lớn nhất – vẫn đang chạy collocated. vLLM gắn mác "experimental" cho tính năng này. "Mùa hè đã tàn, nhưng tro vẫn còn âm ỉ" – batch inference vẫn là hiện tại, nhưng những đám tro đó đang âm ỉ cháy dưới lớp vỏ cũ.
Góc nhìn phản trực giác: liệu agentic traffic có thực sự đủ lớn để biện minh cho một cuộc cách mạng hạ tầng? Tôi nhớ lại câu chuyện về YAM Finance năm 2020 – mọi người đổ xô vào một ý tưởng có vẻ hợp lý, nhưng 48 giờ sau sụp đổ vì lỗi hợp đồng. Disaggregated serving cũng vậy: nếu agent traffic chỉ chiếm 10% tổng inference, thì việc đầu tư vào RDMA, bộ định tuyến session, và lưu trữ KV cache phân tán có thể là quá sớm. Hơn nữa, các dự án crypto như Bittensor hay Akash đang xây dựng inference phi tập trung – liệu họ có thể áp dụng kiến trúc này, hay sẽ bị bỏ lại phía sau vì thiếu hạ tầng mạng tốc độ cao? Họ nói: "Đây là tương lai." Nhưng tôi thấy vết xe đổ từ những đợt hype trước: khi quá tập trung vào một narrative, chúng ta dễ quên rằng hạ tầng không chỉ là hiệu năng, mà còn là độ tin cậy và chi phí vận hành.
Takeaway cho thị trường crypto: Các token AI (như FET, AGIX, RNDR) đang phản ánh kỳ vọng vào agent tự động. Nhưng nếu hạ tầng inference tập trung tiếp tục tối ưu cho agentic traffic, các nền tảng phi tập trung sẽ phải đối mặt với bài toán chi phí và độ trễ. Ngược lại, nếu disaggregated serving trở thành tiêu chuẩn, nó có thể mở ra cơ hội cho các dự án DePIN cung cấp KV cache lưu trữ hoặc routing phi tập trung. Cái bẫy đã giương. Ai sẽ là người giật dây?


