Chủ ngữ của AI đã thay đổi: từ việc mua GPU đến việc bàn giao nhà máy AI

Khi sức mạnh tính toán trên sổ sách không còn tương đương với đầu ra thực tế, thứ tự giá trị trong chuỗi công nghiệp đang được sắp xếp lại
Trong hai năm qua, câu chuyện về cơ sở hạ tầng AI gần như bị chi phối bởi ba thứ.
GPU (Graphics Processing Unit, bộ xử lý đồ họa), HBM (High Bandwidth Memory, bộ nhớ băng thông cao) và đóng gói tiên tiến.
Cách phán đoán này đã nắm trúng cốt lõi của làn mở rộng đầu tiên, đồng thời khiến thị trường dần hình thành một sự hiểu gần như phản xạ có điều kiện: chip càng nhiều thì sức mạnh tính toán càng mạnh, sản lượng càng lớn.
Đến hôm nay, phương trình đó bắt đầu mất hiệu lực.
GPU có thể về hàng, máy chủ có thể nhập kho, và chi tiêu vốn cũng có thể tiếp tục tăng, nhưng năng lực tính toán chưa chắc đã lên tuyến đúng thời điểm. Một nhà máy AI hoàn toàn có thể đồng thời sở hữu thiết bị đắt nhất và những thời gian chờ đợi khó chịu nhất.
Đợi điện, đợi làm mát, đợi mạng, đợi dữ liệu, đợi điều độ.
Chip đã đi vào bảng cân đối kế toán, nhưng năng lực công suất thực sự vẫn nằm ở giai đoạn thi công, chạy thử và tích hợp đồng bộ hệ thống. Kế hoạch mua sắm có thể rất đẹp, nhưng số cụm có thể vận hành ổn định lại ít hơn dự kiến. Về mặt danh nghĩa thiết bị đã được triển khai, nhưng mức sử dụng thực tế và sản lượng theo đơn vị vẫn chưa cao.
Khoảng cách kiểu này đang làm thay đổi cách đo lường trong ngành AI.
Trọng điểm của vòng cạnh tranh đầu tiên là ai có thể lấy được nhiều chip hơn. Khoảng cách ở giai đoạn tiếp theo lại nằm nhiều ở ai có thể tổ chức chip thành một nhà máy AI vận hành ổn định.
Chip quyết định giới hạn lý thuyết, hệ thống quyết định tỷ lệ hiện thực hóa.
Hiểu được điều này thì mới thực sự bước vào giai đoạn tiếp theo của cơ sở hạ tầng AI.
Thiếu chip giải thích cho “nửa chặng đầu”
GPU vẫn là thiết bị cốt lõi cho tính toán AI.
Huấn luyện và suy luận mô hình quy mô lớn cần thực hiện tính toán song song cỡ lớn; GPU cung cấp năng lực tính toán quan trọng nhất. HBM áp sát bộ tăng tốc, truyền dữ liệu đến các đơn vị tính toán với băng thông rất cao. Dù hiệu năng chip có mạnh đến đâu, nếu dữ liệu không đến kịp, các đơn vị tính toán vẫn rơi vào trạng thái chờ.
Đóng gói tiên tiến có trách nhiệm tổ chức chip tính toán, HBM và liên kết tốc độ cao thành một cấu trúc mật độ cao. Năng lực tính toán, băng thông bộ nhớ, diện tích chip, mức tiêu thụ điện và tản nhiệt—cuối cùng đều phải hội tụ ở tầng đóng gói.
Không có các “bệ đỡ” này thì không thể nói đến nhà máy AI.
Trong vài năm qua, thị trường xoay quanh việc mua GPU, hạn mức HBM và dự phán kế hoạch sản xuất của đóng gói tiên tiến đối với độ nóng của AI đều có cơ sở thực tế. Khi toàn ngành thiếu chip tính toán cao cấp, ai lấy được chip thì người đó càng tiến gần giới hạn công suất.
Lúc đó, mâu thuẫn chính tập trung vào bản thân tư liệu sản xuất.
Thiếu chip thì dù mạng, cấp điện và làm mát phía sau có tốt đến đâu cũng không có đủ thiết bị để vận hành. Nhịp cung ứng của GPU cao cấp gần như có thể quyết định trực tiếp kế hoạch huấn luyện của công ty mô hình và tốc độ mở rộng năng lực tính toán của nhà cung cấp cloud.
Khung cũ vẫn đúng, chỉ là nó đã không giải thích được hết mọi vấn đề.
Khi ngày càng nhiều vốn, nhân tài và nguồn lực chuỗi cung ứng đổ về phía chip, cánh cửa đầu tiên dần được nhiều người nhận ra hơn, và những ràng buộc phía sau bắt đầu bước vào tầm nhìn. Liệu chip có sản xuất được hay không vẫn quan trọng. Sau khi chip được sản xuất ra, liệu có thể hình thành công suất sử dụng được đúng tiến độ hay không đã trở thành một bài toán khó khác—cũng đắt giá không kém.
Cơ sở hạ tầng AI đang chuyển từ cuộc cạnh tranh thiếu tư liệu sản xuất sang cuộc cạnh tranh về năng lực bàn giao hệ thống.
Một nhà máy AI phức tạp hơn nhiều so với chỉ một danh sách mua sắm
Danh sách mua sắm có thể cho mọi người biết đã mua bao nhiêu GPU, bao nhiêu máy chủ và bao nhiêu tủ rack.
Nó không trả lời được các thiết bị này lúc nào thì được cấp điện, lúc nào tạo thành được một cụm ổn định, lúc nào có thể tiếp nhận tải thực tế, và khi nào có thể liên tục cung cấp dịch vụ huấn luyện và suy luận với chi phí hợp lý.
Từ lúc chip xuất xưởng đến khi thực sự hoàn thành nhiệm vụ mô hình, ở giữa tồn tại một chuỗi dài.
GPU và HBM cần được đóng gói thành nền tảng có thể bàn giao, rồi mới đi vào card, máy chủ và tủ rack.
Tủ rack cần đủ điện và khả năng làm mát; nhiều nút cần phối hợp qua mạng tốc độ cao. Dữ liệu huấn luyện và ngữ cảnh suy luận phải liên tục chảy giữa tính toán, bộ nhớ và lưu trữ; hệ thống điều độ cũng phải giảm xếp hàng, tắc nghẽn và quay không.
Sau đó, cả bộ hệ thống còn phải trải qua lắp đặt, chạy liên động, thử nghiệm tải, diễn tập sự cố và nghiệm thu tại hiện trường.
Bất kỳ đoạn nào đến trễ thì vốn ở phía trước đều phải chờ.
Chip đã được giao, nhưng nguồn điện cấp cho tủ rack vẫn chưa sẵn sàng; thiết bị chỉ có thể nằm ở kho hoặc phòng máy. Tủ rack đã có điện, nhưng năng lực làm mát không theo kịp, nên hệ thống không thể vận hành liên tục ở mức tải đầy. Toàn bộ phần cứng đã sẵn sàng, nhưng mạng bị tắc nghẽn; nhiều GPU vẫn phải chờ dữ liệu và đồng bộ.
Đó chính là khác biệt quan trọng nhất giữa “nhà máy AI” và trung tâm dữ liệu thông thường.
Trung tâm dữ liệu truyền thống có thể chứa nhiều máy chủ tương đối độc lập, xử lý các tải như lưu trữ, website, phần mềm doanh nghiệp và điện toán đám mây phổ thông. Nhà máy AI cần để các nút tính toán quy mô lớn phối hợp xoay quanh cùng một tác vụ huấn luyện hoặc dịch vụ suy luận.
Yêu cầu của nó đối với hiệu suất đồng bộ, mật độ công suất, quản lý nhiệt, băng thông bộ nhớ và độ ổn định vận hành cao hơn rất nhiều.
Một máy chủ đơn lẻ là rất mạnh, nhưng không thể suy ra tự nhiên rằng cả cụm cũng sẽ mạnh.
Số nút càng nhiều thì độ khó phối hợp của hệ thống càng lớn. Độ trễ của liên kết cục bộ, một thiết bị bị lỗi, một bất thường về nhiệt độ—đều có thể làm chậm cả một loạt tài nguyên tính toán đắt tiền.
Trước đây, người ta hiểu năng lực tính toán như tổng của chip và máy chủ.
Giờ đây, cách hiểu gần thực tế hơn là năng lực tính toán AI là một sản lượng đầu ra của hệ thống chỉ hình thành sau khi trải qua đóng gói, kết nối, cấp điện, làm mát, lưu trữ và điều độ.
Thiết bị đến nơi cho thấy tài sản đã hình thành.
Chỉ khi vận hành ổn định thì mới chứng minh rằng công suất thật sự đã hình thành.
Hiệu suất tính toán hữu hiệu đang trở thành thước đo mới
Năng lực tính toán trên sổ sách mô tả số lượng thiết bị và đỉnh lý thuyết.
Hiệu suất tính toán hữu hiệu quan tâm đến việc các thiết bị này cuối cùng hoàn thành bao nhiêu công việc huấn luyện và suy luận ổn định, có thể điều phối và có thể duy trì.
Cụm GPU cùng quy mô có thể có hoàn toàn khác nhau về sản lượng thực tế.
Một hệ thống thường xuyên phải chờ truyền thông mạng và đọc dữ liệu thì mức sử dụng GPU sẽ thấp hơn dự kiến. Một hệ thống khác làm chín hơn về mạng, bộ nhớ và điều độ—dù quy mô phần cứng không có ưu thế rõ rệt—vẫn có thể hoàn thành nhiều tác vụ hơn trong cùng khoảng thời gian.
Các con số trên sổ sách trông có vẻ gần nhau, nhưng năng lực sản xuất thực tế đã tạo ra khoảng cách.
Hiệu suất tính toán hữu hiệu ít nhất bao gồm vài lớp ý nghĩa.
Thiết bị có thể lên tuyến đúng tiến độ, cụm có thể phối hợp hiệu quả, tác vụ có thể hoàn thành ổn định, và chi phí đầu ra theo đơn vị cũng phải nằm trong phạm vi có thể duy trì sử dụng.
Yêu cầu mà huấn luyện và suy luận đặt lên hệ thống này không giống nhau.
Trong quá trình huấn luyện, một mô hình thường được chia thành nhiều GPU. Các nút khác nhau phải thường xuyên trao đổi dữ liệu và đồng bộ tham số. Một số nút nếu bị chậm thì các nút còn lại cũng phải chờ.
Kiểu chờ đợi này không được viết trong hiệu năng lý thuyết của chip, nhưng nó sẽ xuất hiện trực tiếp trong chu kỳ huấn luyện, chi phí điện, mức sử dụng thiết bị và chi phí kỹ sư.
Suy luận đối mặt với một bộ áp lực khác.
Người dùng thực liên tục gửi yêu cầu, hệ thống cần bắt đầu phản hồi trong thời gian ngắn và vẫn phải duy trì ổn định trong điều kiện đồng thời cao.
Ngữ cảnh ngày càng dài, tương tác nhiều vòng ngày càng phổ biến; tác nhân (agent) bắt đầu gọi công cụ và thực hiện các tác vụ phức tạp hơn, hệ thống cần lưu và đọc đi đọc lại một lượng lớn trạng thái trung gian.
KV cache (Key-Value cache, bộ nhớ đệm khóa-giá trị) từ đó dần trở thành một phần quan trọng trong chi phí suy luận.
Những trạng thái trung gian này sẽ chiếm dụng VRAM đắt tiền, đồng thời ảnh hưởng đến bộ nhớ, lưu trữ, mạng và điều độ.
Toàn bộ đặt trong HBM thì chi phí quá cao. Tràn sang bộ nhớ thường hoặc lưu trữ sẽ làm tăng độ trễ truy cập. Hệ thống phải liên tục cân bằng giữa tốc độ, dung lượng và chi phí.
Vì vậy, chi phí theo mỗi token cũng trở thành một chỉ tiêu quan trọng hơn.
Chi phí của một token cuối cùng do chip tính toán, bộ nhớ, mạng, lưu trữ, điện, làm mát và hiệu suất phần mềm cùng quyết định. GPU chỉ là một trong những phần đắt nhất và dễ thấy nhất.
Nếu dữ liệu không được gửi kịp tới GPU, thì thiết bị đắt tiền sẽ quay không.
Nếu mạng bị tắc nghẽn, thông lượng suy luận và thời gian phản hồi đều sẽ tệ đi.
Nếu hiệu quả quản lý bộ nhớ đệm quá thấp, VRAM sẽ bị lấp đầy rất nhanh.
Nếu năng lực làm mát không đủ, thiết bị không thể duy trì tải cao.
Nếu khôi phục sau sự cố chậm, thì một vấn đề cục bộ có thể kéo theo cả một nhóm tác vụ bị ảnh hưởng.
Những chi tiết kỹ thuật trông giống như công việc kỹ sư trong phòng máy cuối cùng đều quy về cùng một kết quả kinh doanh.
Cùng một khoản đầu tư vốn, rốt cuộc có thể tạo ra bao nhiêu năng lực mô hình ổn định.
Quy mô càng lớn thì khuyết điểm của hệ thống càng đắt
Cụm quy mô nhỏ có thể che giấu nhiều vấn đề bằng dự phòng và can thiệp thủ công.
Khi quy mô mở rộng, các vấn đề cục bộ sẽ nhanh chóng biến thành vấn đề hệ thống.
Tăng số lượng nút tính toán sẽ không khiến sản lượng tự nhiên tăng theo cùng tỷ lệ. Số nút càng nhiều, độ phức tạp về truyền thông và đồng bộ càng lớn, và càng nhiều điểm lỗi.
Mật độ công suất, lượng nhiệt và áp lực đi dây sẽ cùng tăng; chi phí phối hợp bên trong hệ thống bắt đầu “ăn” một phần gia tăng phần cứng.
Đây cũng là lý do mạng sớm bước ra tiền tuyến.
Một GPU đơn lẻ có thể tự hoàn thành một phần tác vụ; nhưng việc huấn luyện mô hình quy mô lớn phụ thuộc vào sự phối hợp quy mô lớn.
Các nút cần trao đổi dữ liệu tốc độ cao và ổn định với nhau. Chỉ cần hiệu suất kết nối giảm nhẹ, các thiết bị tính toán đắt tiền sẽ phải tốn thêm thời gian để chờ.
GPU bổ sung vẫn tăng lý thuyết về năng lực tính toán, nhưng sản lượng bổ sung lại không tăng tương ứng.
Các hạn chế do điện năng mang lại càng trực tiếp.
Trung tâm dữ liệu có được đất đai và quy hoạch điện năng không có nghĩa là điện đã đi vào tủ rack.
Dung lượng còn phải đi qua nhiều khâu như đấu nối, trạm biến áp, phân phối trong trạm, nguồn dự phòng, thanh cái và các chuyển đổi bên trong tủ rack. Bất kỳ khâu nào trễ hạn cũng sẽ làm chậm việc lên tuyến thiết bị.
Khi điện năng đi vào chip, hầu như đều sẽ chuyển hóa thành nhiệt.
Khi công suất của mỗi tủ rack tiếp tục tăng, không gian chịu tải của quạt gió làm mát truyền thống dần trở nên hẹp hơn.
Làm mát bằng chất lỏng bắt đầu đi từ việc chỉ là thiết bị đi kèm trong phòng máy sang thiết kế máy chủ và tủ rack, và tiếp tục ảnh hưởng đến đường ống, phân phối chất làm mát, quy trình bảo trì, bố trí phòng máy và nghiệm thu tại hiện trường.
Vì vậy, ý nghĩa của giải pháp làm mát cũng thay đổi.
Nó không chỉ ảnh hưởng đến nhiệt độ chip; nó còn thay đổi thời điểm dự án có thể bàn giao, ai chịu trách nhiệm khi xảy ra lỗi, cách bảo trì thiết bị và liệu tủ rack có duy trì được tải cao lâu dài hay không.
Sau khi quy mô suy luận mở rộng, áp lực hệ thống tiếp tục lan sang bộ nhớ và lưu trữ.
Bối cảnh dài, hội thoại nhiều vòng và tác vụ của tác nhân sẽ tạo ra nhiều trạng thái hơn.
Hệ thống cần quyết định nội dung nào giữ trong bộ nhớ đệm video tốc độ cao (VRAM), nội dung nào đưa vào bộ nhớ thường, nội dung nào chuyển sang lưu trữ cục bộ hoặc lưu trữ mạng, và nội dung nào có thể tái sử dụng cache giữa các yêu cầu.
Cuộc cạnh tranh về năng lực tính toán bắt đầu chuyển từ hiệu năng từng card sang việc sắp đặt dữ liệu và điều phối tài nguyên.
Những ràng buộc này sẽ không xuất hiện lần lượt theo một lịch trình thời gian gọn gàng. Nền tảng khác nhau, tải khác nhau, phòng máy khác nhau sẽ đồng thời đối mặt với những điểm yếu khác nhau.
Cụm huấn luyện dễ phơi bày các vấn đề về mạng và thông lượng dữ liệu hơn.
Cụm suy luận dễ bộc lộ các vấn đề về trí nhớ ngữ cảnh, thời gian phản hồi và chi phí đơn vị.
Phòng máy công suất cao sẽ sớm gặp áp lực về cấp điện và làm mát.
Xu hướng chung đã rất rõ ràng. Quy mô chip càng lớn thì những khâu hỗ trợ vốn từng nằm ở “hậu trường” càng bước vào hàm sản xuất. Khuyết điểm của hệ thống cũng sẽ ngày càng đắt.
Câu chuyện về đóng gói tiên tiến bắt đầu đi sâu hơn
Mạng, điện và làm mát bằng chất lỏng ra tiền tuyến không hề làm suy giảm tầm quan trọng của đóng gói tiên tiến.
Đóng gói tiên tiến vẫn là ràng buộc nền tảng của nhà máy AI, chỉ là bản thân nó cũng đang bước vào một giai đoạn mới.
Trọng điểm của giai đoạn một là công suất.
Chip AI cao cấp mở rộng nhanh, còn chip tính toán và HBM cần thông qua đóng gói phức tạp để tạo liên kết mật độ cao.
Lịch sản xuất khả dụng có giới hạn, tốc độ mở rộng công suất ảnh hưởng trực tiếp đến việc giao chip. Vì vậy thị trường đặc biệt quan tâm ai có nhiều công suất hơn và ai có thể mở rộng nhanh hơn.
Những khó khăn của giai đoạn hai bắt đầu đi sâu vào các hạng mục như tỷ lệ đạt, kiểm tra, substrate, quản lý nhiệt, phối hợp quang-điện và bàn giao cấp hệ thống.
Khi độ phức tạp tăng lên, công suất danh nghĩa không còn mô tả đầy đủ nguồn cung thực tế.
Trong một gói đóng gói AI cao cấp, có thể đồng thời đưa vào nhiều die tính toán, nhiều stack HBM, lớp trung gian lớn hơn và hệ liên kết tốc độ cao dày đặc hơn. Giá trị sản phẩm tăng nhanh, và chi phí cho mọi khiếm khuyết cục bộ cũng được khuếch đại theo.
Nếu một die gặp vấn đề, tổn thất có thể không chỉ là một con chip.
HBM, lớp trung gian, substrate, công giờ thiết bị và tài nguyên kiểm tra được đóng gói cùng—tất cả đều có thể bị lãng phí.
Giá trị của đóng gói càng cao thì càng cần nhận diện sớm các die có vấn đề; và càng cần thực hiện các bài kiểm tra hệ thống phức tạp sau khi đóng gói hoàn tất.
Lập kế hoạch sản xuất giải quyết được “làm được bao nhiêu”.
Tỷ lệ đạt và kiểm tra quyết định có bao nhiêu phần có thể bàn giao.
Vì thế, vị trí của các thử nghiệm tiên tiến sẽ tiếp tục tăng lên. Nhiều chip die và xếp chồng HBM khiến tổ hợp lỗi phức tạp hơn, và kiểm tra xuất xưởng truyền thống đã không còn đủ.
Việc sàng lọc chip die, kiểm tra sau đóng gói, thử nghiệm lão hóa, chu kỳ nhiệt và xác thực cấp hệ thống đều ảnh hưởng đến chất lượng bàn giao cuối cùng.
Substrate cũng đang chuyển từ hậu trường ra tiền tuyến.
Diện tích đóng gói mở rộng, mật độ đường dây tăng, thì yêu cầu đối với độ phẳng của substrate, kiểm soát độ cong vênh, độ ổn định vật liệu và năng lực cung ứng cũng sẽ tăng. Một substrate nhìn thì chỉ là kết cấu đỡ, nhưng thực tế quyết định chip phức tạp có kết nối ổn định được hay không, có kiểm soát được ứng suất nhiệt hay không, và có đi vào sản xuất quy mô hay không.
Phối hợp quang-điện sẽ đẩy đóng gói sang một tầng độ phức tạp khác.
Khi các lộ trình như CPO (Co-Packaged Optics, quang học đóng gói chung) đưa động cơ quang tiến gần vị trí của chip trao đổi, thì nguồn laser, kết nối cáp quang, căn chỉnh quang học, quản lý nhiệt, độ tin cậy và phương thức bảo trì đều phải được tổ chức lại.
Vì thế, ranh giới của đóng gói tiếp tục được mở rộng.
Nó không chỉ kết nối chip logic và bộ nhớ; dần dần nó còn kết nối việc tính toán, nhập/xuất, quang học, tản nhiệt và bảo trì hệ thống.
Đóng gói tiên tiến đương nhiên vẫn sẽ tiếp tục mở rộng công suất, nhưng phần đáng được đánh giá lại trong tương lai có thể sẽ không còn tập trung vào bản thân công suất danh nghĩa.
Năng lực quyết định liệu có thể sản xuất ổn định hàng loạt các gói đóng gói phức tạp, có giảm hao hụt được hay không, và có giao đúng hạn hay không sẽ nhận được trọng lượng lớn hơn trong ngành.
Kiểm tra tiên tiến, substrate cao cấp, thiết bị đo lường, vật liệu then chốt, căn chỉnh quang học, thiết kế nhiệt và xác thực cấp hệ thống—đều có thể trở thành vùng giá trị quan trọng của giai đoạn hai cho đóng gói tiên tiến.
Đóng gói tiên tiến không rời khỏi đường ray chính.
Nó đang chuyển từ câu chuyện công suất nổi bật nhất sang các khâu chi tiết hơn, khó sao chép hơn và gần với giao hàng thực tế hơn.
Giá trị ngành sẽ tập trung vào năng lực bàn giao
Khi đơn vị đo lường của AI chuyển từ số lượng thiết bị sang hiệu suất tính toán hữu hiệu, thứ tự giá trị của chuỗi công nghiệp cũng sẽ thay đổi.
Mạng, điện, làm mát bằng chất lỏng, bộ nhớ, lưu trữ, chip tùy biến và đóng gói tiên tiến—trông có vẻ thuộc các ngành khác nhau. Nhưng giờ chúng được nối với nhau bởi cùng một vấn đề.
Ai có thể chuyển đổi năng lực chip thành sản lượng đầu ra hệ thống ổn định.
Trước đây mạng chủ yếu đảm nhiệm chức năng truyền dữ liệu. Khi quy mô cụm tăng lên, nó bắt đầu ảnh hưởng trực tiếp đến hiệu suất huấn luyện, thông lượng suy luận và mức sử dụng GPU.
Điện năng trước đây là điều kiện nền của trung tâm dữ liệu. Khi tủ rack công suất cao xuất hiện, thời gian đấu điện và phân phối điện trong trạm bắt đầu quyết định dự án khi nào có thể lên tuyến.
Hệ thống làm mát trước đây từng được xem là thiết bị đi kèm.
Sau khi chất làm lạnh dạng lỏng đi vào máy chủ và tủ rack, nó bắt đầu ảnh hưởng đến thiết kế cả tủ, chu kỳ bàn giao và trách nhiệm bảo trì.
Bộ nhớ và lưu trữ trước đây chủ yếu được cân bằng theo dung lượng. Sau khi tải suy luận tăng lên, chúng ngày càng tham gia sâu vào tốc độ phản hồi, tái sử dụng cache và chi phí đơn vị.
Trước đây, đóng gói tiên tiến chủ yếu được định nghĩa bởi mở rộng công suất và lập lịch sản xuất. Tỷ lệ đạt, kiểm tra, substrate và phối hợp hệ thống đang phân bổ lại giá trị trong đó.
Chip tùy biến cũng sẽ phát triển theo logic này.
Ý nghĩa của nó không chỉ là cung cấp thêm một lựa chọn chip, mà còn là tổ chức chặt hơn việc tính toán, bộ nhớ, mạng và điều phối phần mềm—đặc biệt là cho tải ổn định—để giảm chi phí đầu ra theo đơn vị.
Những thay đổi này không khiến tất cả nhà cung cấp liên quan được hưởng lợi trung bình.
Tăng chi tiêu vốn chỉ chứng minh nhu cầu tồn tại, không chứng minh lợi nhuận sẽ được phân bổ đồng đều. Việc phát hành tiêu chuẩn chỉ cho thấy lộ trình được ghi nhận, nhưng vẫn còn một chặng đường công trình rất dài trước khi triển khai quy mô.
Mẫu thử và thiết kế tham chiếu thể hiện năng lực công nghệ; doanh thu từ sản xuất hàng loạt vẫn phải qua chứng nhận của khách hàng, thích ứng tại hiện trường và bàn giao ổn định.
Sau khi ngành bước vào giai đoạn này, năng lực thường có giá trị cao nhất lại không nằm ở những thông số nổi bật nhất.
Chúng thể hiện ở việc có giao hàng đúng hạn hay không, có kiểm soát được tỷ lệ đạt hay không, có vượt qua chứng nhận của khách hàng hay không, có giải quyết được giao diện hệ thống hay không, và có chịu trách nhiệm bảo trì tại hiện trường và nghiệm thu hay không.
Một thành phần riêng lẻ có hiệu năng dẫn đầu, khách hàng chưa chắc đã lập tức áp dụng.
Một giải pháp trưởng thành dù tham số không quá “tấn công”, miễn là cung ứng ổn định, bảo trì thuận tiện và có thể lên tuyến đúng thời điểm, thì vẫn có thể giữ một vị trí vững mạnh trong ngành.
Đây cũng là chỗ dễ bị hiểu nhầm nhất trong việc chuyển dịch “hồ lợi nhuận” ở vòng tiếp theo.
Không gian nhu cầu rất lớn không có nghĩa là biên lợi nhuận chắc chắn sẽ tăng.
Sản phẩm đi vào chuỗi cung ứng AI không đồng nghĩa với việc nắm quyền định giá.
Tăng trưởng xuất hàng nhanh không có nghĩa là giá trị nhất định vẫn nằm trong tay nhà cung cấp.
Những năng lực thực sự tiến gần đến “hồ lợi nhuận” là các năng lực có thể gánh trách nhiệm giao hàng, giảm hao tổn của hệ thống và khó bị thay thế nhanh chóng.
Giá trị của ngành sẽ không dừng lại ở những danh từ hot nhất.
Nó sẽ chuyển đến những chỗ khó giải quyết nhất, gần với điểm tạo ra sản lượng nhất và cũng dễ làm chậm cả chuỗi dài nhất.
Xu hướng này sẽ trải qua nhiều lần lặp lại
Nhà máy AI đi theo hướng kỹ sư hóa hệ thống, hướng đi đã rõ ràng. Nhịp độ sẽ không phải là một đường thẳng.
GPU, HBM và đóng gói tiên tiến vẫn có thể trở thành những nút thắt cổ chai tuyệt đối mạnh hơn. Chỉ cần nguồn cung thượng nguồn lại siết chặt, sự chú ý của thị trường sẽ quay lại bản thân tư liệu sản xuất.
Chi tiêu vốn của các nhà cung cấp cloud và công ty mô hình cũng ảnh hưởng đến toàn bộ chuỗi. Khi nhịp xây dựng chậm lại, các dự án về mạng, điện, làm mát bằng chất lỏng và trung tâm dữ liệu cũng sẽ được điều chỉnh theo.
Cải thiện về cấu trúc mô hình và hiệu suất phần mềm sẽ hấp thụ một phần áp lực phần cứng.
Cấu trúc mô hình tốt hơn, tỷ lệ hit cache cao hơn và điều phối thông minh hơn có thể giảm tính toán lặp lại và di chuyển dữ liệu. Một số vấn đề trước đây cần giải bằng mở rộng quy mô có thể được phần mềm tối ưu hóa để giảm bớt.
Mở rộng nguồn cung cũng sẽ làm suy yếu phần lợi nhuận giữ lại.
Một mắt xích dù đã vào tuyến chính, chỉ cần công suất được giải phóng quá nhanh, đối thủ tràn vào số lượng lớn, hoặc sản phẩm nhanh chóng được tiêu chuẩn hóa, thì tăng trưởng doanh thu vẫn có thể đi kèm áp lực giảm giá.
Các nền tảng quy mô lớn bản thân cũng có năng lực đàm phán giá rất mạnh. Chúng vừa tạo ra nhu cầu, vừa có thể giữ lại một phần giá trị gia tăng mới trong nội bộ nền tảng thông qua mua sắm tập trung, thiết kế tự phát triển và chạy song song nhiều lộ trình.
Những thay đổi này không lật đổ “đường ray chính” của nhà máy AI; chỉ thay đổi vị trí, thời lượng xuất hiện của nút thắt cổ chai và cách phân bổ giá trị.
Có thể xác định rằng, chỉ dựa vào số lượng GPU để phán đoán công suất AI đã ngày càng tiến gần đến sự sai lệch.
Bàn giao cấp hệ thống sẽ trở thành mốc ranh giới quan trọng hơn.
Đơn vị đo lường mới của AI
Mở rộng cơ sở hạ tầng AI ở vòng đầu tiên, so sánh ai có thể nắm được những chip khan hiếm nhất.
Giai đoạn tiếp theo so sánh ai có thể tổ chức các chip này thành một hệ thống công nghiệp vận hành liên tục.
GPU cung cấp năng lực tính toán cốt lõi.
HBM đảm bảo dữ liệu có thể đi nhanh vào các đơn vị tính toán.
Đóng gói tiên tiến tổ chức việc tính toán, bộ nhớ và kết nối tốc độ cao thành một nền tảng có thể bàn giao, và tiếp tục đi sâu vào tỷ lệ đạt, kiểm tra, substrate và phối hợp quang-điện.
Mạng biến việc kết nối tính toán điểm đơn thành năng lực cụm.
Điện và làm mát khiến thiết bị thực sự lên tuyến.
Bộ nhớ, lưu trữ và điều phối quyết định hiệu quả của hệ thống và chi phí cho mỗi lần suy luận.
Những khâu này cùng hoàn thành bước chuyển đổi cuối cùng, biến tài sản trên sổ sách thành năng lực mô hình có thể sử dụng bền vững.
Việc bàn giao cuối cùng của “nhà máy AI” không phải là một chuỗi số lượng GPU, cũng không phải là một danh sách chi tiêu vốn khổng lồ.
Nó bàn giao một thời gian huấn luyện ổn định, thông lượng suy luận dự đoán được, chi phí đơn vị có thể chịu được và năng lực tính toán hữu hiệu đáp ứng nhu cầu thực tế trong dài hạn.
Giai đoạn một cạnh tranh ở năng lực lấy chip.
Giai đoạn hai so sánh năng lực tổ chức hệ thống.
Khi thay đổi cách đo lường theo đơn vị, tọa độ giá trị của chuỗi công nghiệp cũng sẽ thay đổi theo. Việc đáng chú ý tiếp theo là: những khâu nào đang hạn chế chip phát huy tác dụng, những năng lực nào có thể giảm chờ đợi, kiểm soát hao tổn và chuyển khoản đầu tư phần cứng đắt tiền thành sản lượng thực.
Đi tiếp dọc theo chuỗi này, khâu thường được khuếch đại đầu tiên là mạng.
GPU càng nhiều thì hiệu suất kết nối càng không thể bị bỏ qua.
Bài tiếp theo sẽ mở rộng từ góc nhìn mạng AI. Mô-đun quang chỉ là điểm bắt đầu; hiệu suất kết nối đang dần trở thành lớp hiệu suất sản xuất của nhà máy AI.
