
TPU (Tensor Processing Unit) là chip chuyên dụng do Google tự thiết kế để chạy các tác vụ trí tuệ nhân tạo, từ huấn luyện mô hình lớn đến suy luận ở quy mô khổng lồ. Khác với GPU đa năng của NVIDIA, TPU được tối ưu riêng cho phép tính tensor — phép toán nền tảng của mọi mô hình học sâu — nên đạt hiệu năng và hiệu suất điện năng vượt trội trong đúng bài toán này.

Cùng với chip TPU cho trung tâm dữ liệu, Google còn có dòng chip Tensor cho điện thoại Pixel, tích hợp engine AI ngay trên thiết bị. Cả hai dòng chip đều là chiến lược phần cứng giúp Google vận hành Gemini và toàn bộ hệ sinh thái AI mà không phụ thuộc vào nhà cung cấp bên ngoài.
TPU trung tâm dữ liệu: từ Trillium đến Ironwood
Tháng 12/2024, Google công bố Trillium (TPU thế hệ thứ 6) lên Google Cloud với hiệu năng gấp 4 lần và tiết kiệm điện hơn 67% so với TPU v5p. Đến tháng 4/2025, Google giới thiệu Ironwood (TPU v7) chuyên cho suy luận AI, mỗi superpod mở rộng tới 9.216 chip với sức mạnh tổng cộng 42,5 exaflops — gấp 24 lần siêu máy tính lớn nhất thế giới tại thời điểm đó. Ironwood chính thức lên Google Cloud từ tháng 11/2025.
Tháng 4/2026, Google công bố thế hệ TPU thứ 8 với hai biến thể chuyên biệt: TPU 8t cho huấn luyện và TPU 8i cho suy luận, hiệu suất điện năng gấp đôi Ironwood, kèm hệ thống làm mát bằng chất lỏng thế hệ thứ 4. Các mô hình Gemini được huấn luyện trực tiếp trên những thế hệ TPU mới nhất — đây là lợi thế tích hợp sâu giữa phần cứng, phần mềm và trung tâm dữ liệu mà đối thủ khó sao chép.

Giá thuê TPU trên Google Cloud
Doanh nghiệp có thể thuê TPU theo giờ, từ mức phổ thông đến cao cấp:
| Dòng chip | Giá theo giờ (on-demand) | Giá hợp đồng 3 năm |
|---|---|---|
| TPU v5e | 1,20 USD | — |
| TPU v5p | 4,20 USD | — |
| Trillium | 2,70 USD | 1,22 USD |
| Ironwood | 12,00 USD | 5,40 USD |
Với mức giá này, các startup và phòng nghiên cứu không cần tự đầu tư phần cứng hàng triệu đô la vẫn tiếp cận được sức mạnh tính toán AI hàng đầu.
Chip Tensor trên Pixel
Trên mảng di động, Tensor G5 ra mắt tháng 8/2025 cùng Pixel 10, lần đầu chuyển sang tiến trình 3nm của TSMC — rời bỏ Samsung Foundry. So với thế hệ trước, Tensor G5 có TPU mạnh hơn 60%, CPU nhanh hơn 34% và chạy Gemini Nano nhanh gấp 2,6 lần, đưa các tính năng AI chạy ngay trên máy như tóm tắt cuộc gọi, xóa vật thể trong ảnh hay trợ lý giọng nói.
Theo các nguồn tin rò rỉ, Tensor G6 dành cho Pixel 11 dự kiến dùng tiến trình 2nm của TSMC, có thể trở thành chip điện thoại 2nm đầu tiên trên thế giới, vượt cả kế hoạch của Apple cho iPhone 18. Nếu đúng, đây sẽ là bước nhảy hiệu năng lớn nhất từ trước đến nay của dòng Tensor.
TPU 8t và TPU 8i: chia việc cho từng loại chip
Thế hệ TPU thứ 8 đánh dấu sự thay đổi lớn trong triết lý thiết kế của Google: thay vì một con chip làm mọi việc, Google tách thành hai dòng chuyên biệt. TPU 8t tập trung vào huấn luyện với thông lượng tính toán và băng thông mở rộng quy mô lớn, trong khi TPU 8i ưu tiên băng thông bộ nhớ cao cho các tác vụ suy luận nhạy cảm độ trễ như chạy chatbot, dịch thuật hay gợi ý nội dung theo thời gian thực. Cả hai đều có hiệu suất điện năng gấp đôi Ironwood và dự kiến lên Google Cloud trong năm nay.
Xu hướng tách chip huấn luyện và suy luận cho thấy thị trường AI đang trưởng thành: khi mô hình đã huấn luyện xong, chi phí vận hành suy luận mới là gánh nặng dài hạn của doanh nghiệp. Một con chip tối ưu riêng cho suy luận giúp giảm đáng kể hóa đơn điện toán hàng tháng cho các ứng dụng AI quy mô lớn.
TPU và cuộc đua với NVIDIA
Dù TPU rất mạnh, Google vẫn là người chơi đơn lẻ trong khi NVIDIA chi phối toàn bộ thị trường chip AI với hệ sinh thái CUDA trưởng thành. Phần lớn doanh nghiệp đang huấn luyện mô hình trên GPU NVIDIA vì phần mềm, công cụ và cộng đồng hỗ trợ đã hoàn thiện suốt nhiều năm. TPU chỉ thực sự hấp dẫn với những tổ chức chấp nhận gắn bó với hệ sinh thái Google Cloud và tối ưu code theo khung phần mềm riêng như JAX.
Điểm yếu lớn nhất của TPU là thiếu hệ sinh thái phần mềm tương đương CUDA, còn điểm mạnh là giá thuê rẻ hơn và hiệu suất điện năng tốt hơn trên cùng khối lượng công việc. Với các công ty khởi nghiệp AI, việc so sánh chi phí giữa thuê GPU và thuê TPU theo giờ trở thành bài toán kinh doanh quan trọng khi quy mô huấn luyện tăng lên.
Chiến lược toàn diện: vì sao Google không trả thuế NVIDIA?
Chiến lược của Google là full-stack: tự thiết kế chip, tự xây mạng nội bộ, tự phát triển phần mềm và tự thiết kế trung tâm dữ liệu. Nhờ kiến trúc đồng bộ từ chip đến hệ thống, các trung tâm dữ liệu của Google hiện cho sức mạnh tính toán gấp 6 lần so với 5 năm trước trên cùng một đơn vị điện năng. Đây là cách Google tránh phụ thuộc vào GPU đắt đỏ của NVIDIA và tối ưu chi phí huấn luyện các mô hình quy mô lớn như Gemini.
Tham khảo thêm
Bạn có thể đọc thông báo chính thức về Ironwood trên blog Google, bảng giá TPU trên Google Cloud và bài giới thiệu TPU thế hệ thứ 8.
