- Một rack Helios gói 72 GPU Instinct MI455X và 18 CPU EPYC Venice, cho 2.9 exaFLOPS FP4 và 31TB HBM4.
- AMD tuyên bố hơn NVIDIA Vera Rubin NVL72 15% hiệu năng FP4, 50% dung lượng bộ nhớ và 30% token trên mỗi USD.
- Anthropic đặt tới 2 gigawatt Helios, OpenAI đưa rack online từ quý 4.
- ROCm.ai để Claude, Codex, Cursor và Gemini hiểu native phần cứng AMD, nhắm thẳng vào hào CUDA.
TL;DR
Tại Advancing AI 2026, AMD không còn bán chip rời. Họ bán nguyên cái rack. AMD Helios - rack-scale AI platform đầu tiên của hãng - đã vào full production với 72 GPU Instinct MI455X và 18 CPU EPYC Venice mỗi rack. Kèm theo là họ GPU Instinct MI400, CPU EPYC 9006 trên tiến trình 2nm, nền tảng phần mềm ROCm.ai và một mảng physical AI cho robot.
Điểm đáng chú ý nhất không phải con số hiệu năng, mà là vị thế: lần đầu tiên trong kỷ nguyên AI, đơn vị cạnh tranh với NVIDIA không còn là con chip mà là cả hệ thống.
Helios thực sự là gì
Helios là một rack double-wide dựng theo chuẩn open rack, 18 khay, chứa 72 GPU Instinct MI455X và 18 CPU EPYC Venice, nối bằng networking Pensando và chạy trên phần mềm mở ROCm. Thông số tổng một rack: 2.9 exaFLOPS peak FP4, 1.4 exaFLOPS peak FP8, 31 TB HBM4, 1.7 PB/s băng thông bộ nhớ, 43 TB/s scale-out và 260 TB/s scale-up.

AMD đã preview Helios từ năm ngoái. Thứ thay đổi là nó đã vào production và đang đi qua kênh OEM. Bối cảnh cũng khác: workload AI đang dịch từ training sang inference và agentic, nơi bài toán không còn là FLOPS thuần mà là chi phí trên mỗi token. Con số marquee của AMD là tới 30% token nhiều hơn trên mỗi USD so với rack NVIDIA Vera Rubin NVL72, đo trên workload Kimi K2 Thinking ở cùng power envelope. Và họ không nói chuyện megawatt nữa - Helios thiết kế cho triển khai đo bằng gigawatt.
Instinct MI400: phân khúc thay vì một chip cho tất cả

Flagship MI455X chạy kiến trúc CDNA 5: 432GB HBM4 mỗi GPU, 23.3 TB/s băng thông, 320 tỷ transistor, compute chiplet 2nm và phần còn lại 3nm. So với MI355X đời trước: gấp 4 lần matrix compute, gấp 1.5 lần dung lượng bộ nhớ, và theo đo đạc của AMD trên Deepseek V4 Flash với FP4 serving thì gấp 34 lần token throughput.
Phần thông minh nằm ở cách chia phân khúc. MI430X lo HPC và sovereign AI với 288 TFLOPS FP64, đang chạy trong lứa siêu máy tính exascale mới ở Mỹ và châu Âu, ship nửa đầu 2027. MI440X gói 8 GPU cùng một CPU Venice cho doanh nghiệp chạy AI on-prem.
Món dễ bị bỏ qua nhưng đáng chú ý nhất với doanh nghiệp thường là MI350P: card PCIe dual-slot, tản nhiệt khí, 144GB HBM3E, cắm vừa server Dell, HPE, Supermicro đã có sẵn. Không tản nhiệt lỏng, không rack tùy biến, không thiết kế lại phòng máy. AMD công bố nó cho tới 4.2 lần token mỗi giây trên mỗi USD so với đối thủ - và đây là lane NVIDIA không tập trung, đối thủ gần nhất chỉ là card server dẫn xuất từ workstation.
EPYC Venice: AMD chọn đánh trên đất nhà

Venice là thế hệ EPYC thứ sáu, kiến trúc Zen 6, và là CPU server x86 đầu tiên vào volume production trên tiến trình 2nm của TSMC. Top-of-stack EPYC 9996 có 256 core và 512 thread mỗi socket. So với Turin đời trước: 1.8x hiệu năng, 1.3x mật độ, 2.6x băng thông bộ nhớ, đạt 1.6 TB/s. Dòng này chẻ theo workload: SP7 cho agent sandbox mật độ cao, SP8 từ 8 tới 128 core cho thiết bị hạn chế điện, 9006X SP7 cho HPC với gấp ba L3 cache mỗi core và xung tới 5.15 GHz.
Cuộc đấu thú vị nhất của tuần đó không phải GPU đấu GPU, mà là AMD dùng EPYC đánh thẳng vào CPU Vera của NVIDIA. NVIDIA đã chủ động publish benchmark Vera ngay trước sự kiện. AMD đáp lại trên sân khấu: 2.2 lần hiệu năng mỗi socket, cộng lợi thế tương thích phần mềm x86 so với Arm.
Lý do CPU quan trọng trở lại: agent dựa vào CPU để orchestration, di chuyển dữ liệu, và những đoạn tuần tự trong pipeline mà accelerator xử lý kém. Santosh Janardhan của Meta nói thẳng trên sân khấu rằng CPU đang trở nên quan trọng ngang GPU, nếu không muốn nói là hơn.
ROCm.ai: dùng AI để đục hào CUDA

Đây có lẽ là công bố quan trọng nhất mà ít gây tiếng vang nhất. Phần cứng chưa bao giờ là điểm yếu chí mạng của AMD - phần mềm mới là.
ROCm.ai là lớp phát triển AI-native đặt trên ROCm mở, cho phép các coding agent phổ biến (Claude, Codex, Cursor, Gemini) hiểu native phần cứng AMD. Thành phần Hyperloom chạy agentic loop: tự profile workload, tìm bottleneck, tune và viết lại kernel, rồi validate kết quả. Demo trên keynote cho thấy Hyperloom tự nâng token rate của đoạn code lên 38%. Bản ROCm mới cũng cải thiện inference 3.3 lần và training 2.4 lần so với ROCm 7, với PyTorch, Hugging Face, vLLM và SGLang đã enable trên MI455X.
Luận điểm của AMD rất rõ: hào CUDA chưa bao giờ chỉ là code, nó là hai thập kỷ chuyên môn tích luỹ, thư viện tối ưu và phản xạ có điều kiện của developer. Không thể tuyển người nhanh bằng NVIDIA, AMD cược rằng AI nén được khoảng cách đó nhanh hơn tuyển dụng.
Ai đã đặt hàng, và đặt bao nhiêu
Danh sách khách hàng Helios gồm OpenAI, Anthropic, Meta, Microsoft, Oracle, HUMAIN, Tensorwave, Vultr, Cirrascale; OEM có Bull, HPE, Lenovo, Supermicro.
- Anthropic mua tới 2 gigawatt Helios, kèm hợp tác kỹ thuật nhiều năm: dùng Claude để tối ưu workload cho Instinct GPU và tăng tốc phát triển ROCm. AMD cũng triển khai Claude rộng rãi trong đội kỹ thuật của chính mình.
- OpenAI đã nhận rack Helios pre-production vài tháng trước, dùng Triton framework với ROCm cho workload GPT-class. Đưa Helios online từ quý 4 năm nay, tăng tốc suốt 2027, bên cạnh 6 gigawatt phần cứng AMD vẫn đang triển khai từ năm ngoái.
- Meta đang validate nền tảng EPYC 6th Gen và test workload trên rack Helios, nhắm co-design cho triển khai gigawatt vào 2028.
- AT&T đốt khoảng 1 nghìn tỷ token mỗi tháng, không chỉ cho chăm sóc khách hàng mà cả lập kế hoạch triển khai thiết bị vật lý. Họ dùng Instinct GPU và ROCm trên hạ tầng Microsoft để train OTel 2.0, model mở dành riêng cho viễn thông.
Bất ngờ thú vị nhất là Cerebras - công ty xây cả doanh nghiệp trên lập luận rằng wafer-scale engine của họ serve token nhanh hơn mọi GPU, giờ lại đem rack AMD vào data center của mình. Logic nằm ở disaggregated inference: pha nạp prompt (prefill) nặng compute và song song hoá tốt, hợp với Instinct và HBM lớn; pha sinh token (decode) tuần tự và bị chặn bởi băng thông, hợp với SRAM lớn. Kết hợp lại cho gấp 5 lần hiệu năng so với wafer-scale engine chạy một mình, có trên Cerebras Cloud nửa cuối năm nay. NVIDIA đi tới đúng kết luận kiến trúc đó nhưng bằng đường khác: tích hợp dọc, đem công nghệ low-latency của Groq về nhà. Cùng đích, hai mô hình kinh doanh.
Physical AI: mặt trận AMD có sẵn vốn
Mảng ít được nhắc nhưng AMD có lợi thế thật, nhờ di sản FPGA và adaptive SoC từ Xilinx. Ryzen AI Embedded X100 Series gộp tới 16 core Zen 5, GPU RDNA 3.5 và một NPU tiết kiệm điện trên cùng một SoC, chạy được từ -40°C tới 105°C với tuổi thọ tới 10 năm. Trên nền đó là Kria AI Robotics Developer Platform - nền tảng turnkey mở đầu tiên gộp CPU, GPU, NPU và FPGA cho robot tự hành, cho phép robot ra hơn 8.000 quyết định mỗi giây với vision-language-action reasoning dưới 1 mili giây.
Kèm theo là AMD Robotics Partner Network, chuẩn hoá trên ROCm - vốn giữ được khoảng 75% code CUDA khi migrate, nghĩa là hãng robot có thể rời silicon NVIDIA mà không viết lại từ đầu.
Phần cần tỉnh táo
Mọi con số ở trên đều do AMD tự công bố, chưa có benchmark độc lập nào. Cả AMD lẫn NVIDIA đều đang so silicon mới nhất của mình với cấu hình chọn lọc kỹ và footnote rất dày. Nên coi chúng là chỉ dấu về hướng đi, không phải con số tuyệt đối cho môi trường của bạn. Vài điểm khác:
- Chuẩn mở đẩy gánh nặng tích hợp sang người mua. Nó giữ được quyền chọn nhà cung cấp và đòn bẩy đàm phán, nhưng khi hệ thống không đạt số thì câu hỏi ai chịu trách nhiệm tích hợp, qualification và support trở nên rối.
- Cam kết của khách hàng không đồng chất. Có cái là capacity bắt đầu deploy năm 2027, có cái là kế hoạch cloud availability, có cái chỉ là OEM channel support. Đà thực sự phải đo bằng capacity đã deploy và doanh thu.
- NVIDIA không phải Intel. Chuyện AMD lật đổ Intel ở mảng CPU server là kẻ thách thức quyết liệt gặp kẻ dẫn đầu đang vấp. NVIDIA thì không lỡ deadline, doanh thu data center hơn 215 tỷ USD năm tài chính gần nhất, và đang chơi tấn công.
- ROCm.ai còn phải chứng minh. Demo nâng token rate 38% là một chuyện; tạo kết quả lặp lại được trên ma trận sản phẩm ngày càng rộng mà không làm phân mảnh trải nghiệm phần mềm là chuyện khác.
Lịch giao hàng và lộ trình tới 2030
Helios đã full production, shipment bắt đầu quý 3 và ramp vào nửa sau 2027. Venice cũng đã full production. MI430X ship nửa đầu 2027. Nền tảng Ryzen AI Halo (chạy Ryzen AI Max PRO 400 Series, kèm một năm Hugging Face Pro mỗi máy) có cuối năm nay. AMD chưa công bố giá bán cho bất kỳ sản phẩm nào trong nhóm này.
AMD cam kết nhịp thường niên: mỗi năm một thế hệ Instinct mới và một hệ thống rack-scale mới, kéo tới 2030.
| Năm | GPU | CPU | Rack |
|---|---|---|---|
| 2027 | Instinct MI500 Series | EPYC "Verano" | Helios 500 (Pensando "Como" / "Monza") |
| 2028 | Instinct MI600 Series (CDNA Next) | Zen 7: "Florence", "Ferrara", "Fidenza" | Helios 600 (Pensando "Palma" / "Levanzo") |
| 2030 | - | Zen 8: "Ravenna" | - |
Kết
Lùi lại khỏi từng công bố lẻ, chiến lược hiện ra khá rõ. AMD không còn đấu NVIDIA từng con chip. Đơn vị cạnh tranh đã dịch sang cả hệ thống, và mua hạ tầng AI giờ đồng nghĩa với mua một kiến trúc. Helios là quân bài của AMD trong ván đó: EPYC lo orchestration, Instinct lo tăng tốc, Pensando tải lưu lượng, ROCm buộc mọi thứ lại. Lisa Su gọi đây là danh mục mạnh nhất trong lịch sử AMD, và hãng định cỡ thị trường mình nhắm tới ở khoảng 2 nghìn tỷ USD vào 2030.
NVIDIA vẫn dẫn trước rõ ràng, và không có gì trong tuần này thay đổi điều đó trong ngắn hạn. Nhưng lần đầu tiên trong kỷ nguyên AI, cuộc cạnh tranh trông giống một trận đấu thật.
Lời khuyên thực dụng cho ai đang cân nhắc: đòi proof of concept trên workload của chính bạn. Khoảng cách giữa con số trên keynote và hiệu năng thực giao là nơi ngân sách đi chết.
Đạo hữu là phàm nhân, tu tiên giả
... hay AI cào nội dung?
Tất cả nội dung tại đạo quán đều miễn phí. Đạo hữu chỉ cần nhập email của mình để đọc tiếp. Nói KHÔNG với Spam. Huỷ subcribe lúc nào đạo hữu thích.
nếu không muốn nhận newsletter thì có thể nhập mail phụ
