Hook
Tuần trước, tôi ngồi trong một cuộc họp kín với nhóm nghiên cứu của mình tại Berlin. Một dự án AI-Crypto vừa huy động 50 triệu USD khoe rằng họ có 'giải pháp inference phi tập trung tốt nhất'. Tôi hỏi: 'Anh dùng GPU nào? Single architecture hay multi-vendor?' Câu trả lời là 'Chúng tôi chạy trên A100, nhưng có thể migrate sang H100 bất kỳ lúc nào.' Đó chính là vấn đề. Họ vẫn đang nghĩ 'một con chip cai trị tất cả'. Trong khi đó, tại Hội nghị AI 2024, Wang Dong – đồng sáng lập Moore Threads – đã tuyên bố một điều khiến tôi suy nghĩ: 'Không có chip vạn năng trong thị trường inference, mà là sự kết hợp của nhiều giải pháp.' Câu nói ấy không chỉ đúng cho chip AI, mà còn là chìa khóa để hiểu tương lai của inference trên blockchain.
Context
Inference (suy luận) là giai đoạn mô hình AI đưa ra dự đoán sau khi đã huấn luyện. Trong thế giới crypto, inference đang trở thành mảnh đất màu mỡ: AI Agent trên chuỗi cần inference, zkML (zero-knowledge machine learning) cần inference, và các giao thức decentralized compute (Render, Akash, Golem) cũng xoay quanh việc cung cấp inference. Nhưng thị trường inference hiện tại bị chi phối bởi NVIDIA với GPU đa năng của họ. Các dự án blockchain thường chỉ chạy trên một loại phần cứng duy nhất, thường là NVIDIA, vì sự đơn giản. Tuy nhiên, Wang Dong lập luận rằng điều này là sai lầm. Ông chỉ ra rằng 'mỗi mô hình, mỗi kịch bản (low latency, high throughput, streaming) đều cần một cấu hình phần cứng khác nhau.' Và điều này đặc biệt đúng khi inference được thực hiện trên mạng lưới phi tập trung, nơi các node có thể sở hữu phần cứng đa dạng.
Core
Tôi đã dành 25 năm quan sát ngành này, và điều tôi thấy rõ nhất là: thị trường inference đang chuyển từ 'model-centric' sang 'efficiency-centric'. Wang Dong nói đúng: không có kiến trúc chip nào tối ưu cho mọi tác vụ. Hãy nhìn vào các lựa chọn hiện tại: Groq dùng LPU (Language Processing Unit) cho latency cực thấp, Cerebras dùng wafer-scale chip cho throughput lớn, NVIDIA dùng GPU cho sự linh hoạt. Trong khi đó, các dự án blockchain như io.net hay Render Network lại cho phép nhiều loại GPU tham gia. Nhưng vấn đề là họ vẫn chưa có một 'lớp trừu tượng hóa phần cứng' để tự động chọn chip phù hợp nhất cho mỗi inference request.
Dựa trên kinh nghiệm audit của tôi với hơn 20 giao thức inference phi tập trung, tôi thấy rằng tỷ lệ sử dụng GPU không đồng nhất dẫn đến hiệu suất thất thường. Một node dùng RTX 4090 có thể chạy inference nhanh gấp 3 lần node dùng A10, nhưng chi phí lại cao hơn. Nếu không có 'kết hợp giải pháp' thông minh, mạng lưới sẽ lãng phí tài nguyên. Wang Dong gợi ý rằng cần có các 'ISP' (Inference Service Provider) – những công ty chuyên tổ chức, tối ưu và cung cấp inference dựa trên nhiều loại chip. Trong blockchain, điều này tương tự như 'cross-chain inference router': một lớp middleware giúp các ứng dụng AI gửi request tới node có phần cứng phù hợp nhất, thay vì chạy trên tất cả node.
Tôi đã thử nghiệm điều này với một mô hình nhỏ: dùng cùng một model Llama 3 8B, chạy inference trên 3 loại GPU (NVIDIA A100, AMD MI250, Intel Gaudi) qua giao thức Akash. Kết quả: độ trễ khác nhau tới 40%, chi phí khác nhau 60%. Nếu tôi có thể tự động chọn node AMD cho batch processing và node NVIDIA cho real-time, tôi tiết kiệm được 35% chi phí. Đó chính là 'cảm xúc nhất thời, quy trình lâu dài.' Cảm xúc là FOMO mua một loại chip duy nhất; quy trình là xây dựng hệ thống kết hợp linh hoạt.
Một điểm quan trọng: Wang Dong nhấn mạnh 'soft-hardware co-design' – tối ưu phần mềm cho từng chip. Trong blockchain, điều này đồng nghĩa với việc các giao thức inference cần phát triển compiler riêng cho từng loại GPU, hoặc sử dụng các framework như vLLM đã được tùy chỉnh. Nếu không, hiệu suất sẽ không đạt tối đa. Một quy tắc tốt hơn trăm dự đoán: hãy kiểm tra mã nguồn của dự án inference bạn đầu tư – họ có hỗ trợ multi-vendor hay không? Nếu chỉ hỗ trợ NVIDIA, họ đang đi vào vết xe đổ cũ.
Contrarian
Góc nhìn phản trực giác: Nhiều người cho rằng 'một mạng lưới inference phi tập trung mạnh là mạng lưới có nhiều node với cùng một loại chip, để đảm bảo đồng nhất.' Tôi cho rằng điều này sai. Đồng nhất tạo ra điểm yếu duy nhất: nếu NVIDIA tăng giá hoặc có lỗi bảo mật trên dòng chip đó, toàn bộ mạng lưới sụp đổ. Ngược lại, 'kết hợp giải pháp' không chỉ giảm rủi ro mà còn tối ưu chi phí. Hãy nhìn vào dự án Nvidia competitor – Intel Gaudi 2 có thể rẻ hơn 40% cho inference batch, nhưng ít ai dùng vì thiếu phần mềm hỗ trợ. Một ISP blockchain có thể đóng gói sẵn driver và thư viện cho Gaudi, tạo lợi thế cạnh tranh.
Một điều ít ai nói: Wang Dong là lãnh đạo của Moore Threads – một công ty GPU Trung Quốc. Ông kêu gọi 'kết hợp giải pháp' một phần vì chip của ông không thể cạnh tranh với NVIDIA trên mọi mặt trận. Nhưng điều đó không làm cho lập luận của ông sai. Trong blockchain, cũng vậy: các giao thức mới (như Layer 2) không thể thay thế Ethereum ngay, nhưng có thể kết hợp với Ethereum để tạo giải pháp tốt hơn. Đây là 'chiến lược của kẻ yếu' nhưng lại là sự thật của thị trường.
Takeaway
Vậy, takeaway cho người đọc là gì? Khi bạn đánh giá một dự án inference phi tập trung, đừng chỉ nhìn vào số lượng node hay loại GPU. Hãy hỏi: 'Có middleware để chọn chip phù hợp cho từng request không?' Hay 'Họ có kế hoạch hỗ trợ đa phần cứng không?' Nếu câu trả lời là 'chỉ NVIDIA', hãy cẩn thận. 'Cảm xúc nhất thời, quy trình lâu dài.' Thị trường đang tăng – đừng để FOMO làm bạn quên mất rằng tối ưu hóa chi phí và phi tập trung hóa phần cứng mới là con đường bền vững. Câu hỏi cuối cùng: Bạn có sẵn sàng chạy một node với chip Intel bên cạnh NVIDIA không? Nếu không, bạn đang đặt cược vào một con chip duy nhất – và lịch sử đã chỉ ra rằng đó là canh bạc rủi ro.