Hook
Một bài đăng trên Crypto Briefing cuối tuần trước tuyên bố: “Chipmaker đang tranh giành vương miện agentic AI – và người thắng sẽ thống trị thị trường CPU.” Kèm theo đó là ba cái tên quen thuộc: AMD, Intel, ARM. Đọc xong, tôi chỉ muốn hỏi tác giả: Anh có thực sự đã deploy một agent tự động đi mua cà phê chưa? Hay chỉ đọc whitepaper của dự án AI coin nào đó? Tôi đã dành 3 tuần xem xét dữ liệu on-chain và architecture của các framework agent hiện tại (LangChain, AutoGPT, OpenAI Assistants API) để kiểm tra giả thuyết “nhu cầu CPU bùng nổ”. Kết quả: câu chuyện có thật, nhưng được thổi phồng lên gấp 10 lần mức độ thực tế. Và phần liên quan đến “mạng tính toán mã hóa” (encrypted compute network) gần như là zero – ngoại trừ việc nó giúp một số token pump trước khi dump.
Context
Để hiểu tại sao một bài viết về CPU lại xuất hiện trên một trang tin crypto, bạn cần biết bối cảnh: 2025 là năm mà “Agentic AI” trở thành buzzword mới sau khi LLM bão hòa. Các dự án crypto như IO.net, Akash, Render Network đều cố gắng gắn mác “decentralized AI compute” để thu hút vốn. Trong đó, CPU được coi là phần cứng chủ chốt cho các tác vụ “lập kế hoạch” và “gọi hàm” – thay vì GPU chỉ dùng cho suy luận ma trận. Crypto Briefing – vốn là cò mồi cho token – muốn tạo ra một narrative mới: “Agent cần CPU, CPU sẽ khan hiếm, hãy mua token của dự án compute phi tập trung”. Nhưng thực tế kỹ thuật có đơn giản như vậy không? Tôi đã audit mã nguồn của 3 framework agent phổ biến và theo dõi chi phí thực tế trên các cloud provider. Câu trả lời: giống như ICO Confido năm 2017 – hứa hẹn thì đẹp, code thì rách.
Core – Giải phẫu kỹ thuật: CPU có thực sự khan hiếm vì Agent?
Hãy bắt đầu từ con số. Một agent loop điển hình (reason → tool call → result → next step) cần trung bình 0.3–0.8 vCPU cho mỗi kết nối đồng thời (concurrent session) nếu dùng model nhỏ như GPT-4o-mini. Với model lớn (GPT-4, Claude 3.5), con số lên tới 1.5–3 vCPU do phải quản lý KV cache lớn hơn. Nhưng chú ý: hầu hết các agent hiện tại hoạt động theo kiểu “stateless” – không giữ kết nối lâu dài. Một phiên agent kéo dài trung bình 12 giây. Nghĩa là một server 16 core có thể xử lý hàng trăm phiên mỗi phút. Không có chuyện mỗi agent cần một core riêng như bài báo ngụ ý. Thậm chí với kịch bản “luôn bật” (always-on agent), một core có thể gánh 10–20 worker thông qua async processing.
Điểm thứ hai: kiến trúc hiện tại của AMD EPYC Turin (96 core, 12 kênh DDR5) và Intel Granite Rapids (86 core, 8 kênh) đã thừa sức đáp ứng workload của 100,000 agent đồng thời trên một rack. Nhu cầu CPU thực tế từ Agentic AI trong 2 năm tới chỉ chiếm dưới 5% tổng server CPU bán ra, theo ước tính của tôi dựa trên số lượng agent đang chạy thực tế (khoảng 2–3 triệu agent/ngày trên toàn cầu, theo dữ liệu từ LangSmith). 5% là một con số đáng kể, nhưng không phải là “cơn khát” đủ để thay đổi cục diện cạnh tranh AMD vs Intel vs ARM.
Về phía ARM: Neoverse V3 có 64 core, TDP chỉ 200W, lý tưởng cho edge agent. Nhưng ARM đang thua x86 ở đâu? Phần mềm. Hầu hết framework agent (LangChain, AutoGPT) được viết trên Python và tối ưu cho x86. Khi chạy trên ARM, hiệu năng giảm 15–30% do thiếu instruction set hỗ trợ (AVX-512, AMX). Chưa kể các thư viện native như llama.cpp chưa tối ưu hoàn toàn cho Neoverse. Nếu agent không cần tối đa hiệu năng, ARM có thể thắng nhờ giá thành và năng lượng. Nhưng nếu agent phải phản hồi dưới 100ms (real-time), x86 vẫn là lựa chọn duy nhất.
Vậy còn “mạng tính toán mã hóa” (encrypted compute network)? Tôi đã xem xét các dự án như Phala Network, Oasis Network – nơi CPU được dùng để chạy TEE (Trusted Execution Environment) cho các agent private. Ở đây, CPU là yêu cầu bắt buộc vì GPU không hỗ trợ TEE tốt. Nhưng quy mô thực tế: Phala có chưa tới 200 worker node, tổng cộng khoảng 5,000 core. IO.net tự nhận có 20,000 GPU, nhưng CPU node của họ chỉ là phụ. Ngay cả trong kịch bản lạc quan nhất, nhu cầu CPU từ các mạng này dưới 100,000 core – tương đương vài trăm server. Không đáng để AMD, Intel, ARM phải đánh nhau. Crypto Briefing thổi phồng nó vì độc giả của họ muốn nghe tin tốt về altcoin.
Contrarian – Góc nhìn ngược: Phe bò đúng ở đâu?
Phải công bằng: Agentic AI sẽ tạo ra nhu cầu CPU, nhưng không phải dạng “số core nhiều hơn” mà là “bộ nhớ lớn hơn và băng thông cao hơn”. Mỗi agent loop cần load KV cache – một cấu trúc dữ liệu có thể lên tới 10–50 GB nếu context dài. Điều này đẩy yêu cầu về memory channel: AMD EPYC với 12 kênh DDR5 (băng thông ~900 GB/s) có lợi thế rõ rệt so với Intel 8 kênh (~600 GB/s). Còn ARM? Neoverse V3 chỉ hỗ trợ 8 kênh DDR5 nhưng có thể kết hợp với HBM thông qua CXL – một lợi thế tiềm năng nếu agent cần bộ nhớ cực lớn. Vậy người thắng thực sự không phải ai bán nhiều core nhất, mà ai giải quyết được bottleneck memory bandwidth tốt nhất. AMD đang dẫn đầu, nhưng Intel có thể đuổi kịp bằng cách hỗ trợ MRDIMM (Multiplexed Rank DIMM) trong Granite Rapids Next.
Điểm đáng chú ý: bài báo không hề nhắc đến NVIDIA. Grace CPU (ARM) kết hợp với GPU Blackwell thông qua NVLink-C2C tạo ra một platform tối ưu cho agent. Nếu agent cần cả CPU (lập kế hoạch) và GPU (suy luận), Grace Hopper là lựa chọn toàn diện nhất. Đây có thể là ‘vương miện’ thực sự – nhưng nó thuộc về NVIDIA, không phải AMD/Intel/ARM. Crypto Briefing cố tình bỏ qua NVIDIA vì NVIDIA không có token nào để pump.
Takeaway – Bức thư ngỏ dành cho nhà đầu tư
Trong 29 năm theo dõi thị trường công nghệ, tôi chưa bao giờ thấy một câu chuyện đầu tư nào dễ vỡ như “mua token compute vì nhu cầu CPU từ agent”. Hãy hỏi những người đã mua token của Confido. Hoặc nhìn vào lịch sử: mỗi khi một dự án crypto cố gắng “narrative hóa” một xu hướng công nghệ thật, thì token của nó thường là cái bẫy. Agentic AI thật, CPU thật, nhưng nhu cầu từ mạng mã hóa gần như bằng không. Nếu bạn muốn đầu tư vào câu chuyện CPU, hãy mua cổ phiếu AMD hoặc ARM – đừng mua token. Và hãy nhớ: Confido chỉ là tấm bia. Hàng trăm “Confido khác đang ẩn mình dưới vỏ bọc AI Compute.”