Tôi đã mất 4 tháng để viết smart contract cho ICO đầu tiên của mình, và chỉ vài giây để bị loại khỏi dự án vì dám lên tiếng về pre-mine.
Năm 2017, ở tuổi 25, tôi tin rằng blockchain là công nghệ giải phóng. Nhưng sự thật mà tôi học được là: phi tập trung không tự động đến từ mã nguồn mở, mà đến từ sự minh bạch và cơ chế đồng thuận thực sự.
Tôi nhớ lại bài học đó khi đọc về cách các nhà cung cấp GPU đám mây mới nổi đang "tận dụng sự khan hiếm của AWS để thu hút các startup AI". Trên bề mặt, đó là một câu chuyện hay về sự cạnh tranh lành mạnh. Nhưng dưới góc nhìn của một người từng đi qua ICO và DeFi Summer, tôi thấy một cấu trúc tương tự đang hình thành.
Context: Sự khan hiếm GPU và cuộc chơi của các đám mây nổi lên
Thị trường đang trong giai đoạn đi ngang. GPU H100 của NVIDIA trở nên khan hiếm đến mức một số startup AI phải chờ đợi hàng tháng để có được tài nguyên từ AWS. Vào khoảng trống này, các nhà cung cấp như Together, Runpod, và Nebius xuất hiện, hứa hẹn GPU giá rẻ hơn, sẵn có hơn.
Nếu bạn là một founder AI non trẻ, điều này nghe có vẻ lý tưởng. Nhưng tôi thấy sự tương đồng với DeFi Summer 2020: khi mọi người đổ xô vào các giao thức có APY hấp dẫn, quên mất rằng phần thưởng đi kèm với rủi ro.
Core: Phân tích kỹ thuật và giá trị của các đám mây GPU mới nổi
Dựa trên kinh nghiệm audit code của tôi, tôi muốn nhấn mạnh ba khía cạnh kỹ thuật mà hầu hết các bài báo bỏ qua:
1. Loại GPU và hiệu suất thực tế
Các nhà cung cấp mới nổi thường sử dụng A100 thay vì H100, hoặc thậm chí RTX 4090 cho inference. Điều này giảm chi phí đáng kể. Tuy nhiên, trong các bài kiểm tra tôi từng thực hiện, A100 khi chạy distributed training trên mô hình 70B+ không thể duy trì hiệu suất do thiếu NVLink. AWS có thể đắt hơn, nhưng bạn trả tiền cho sự ổn định.
2. Mạng liên kết và độ trễ
AWS sử dụng NVLink + InfiniBand cho các cluster GPU. Các nhà cung cấp mới nổi thường dùng Ethernet hoặc InfiniBand cấp thấp. Đối với các startup chỉ cần inference đơn giản, điều này không phải vấn đề. Nhưng nếu bạn đang training một mô hình mới, sự khác biệt về độ trễ có thể kéo dài thời gian training lên 2-3 lần.
3. Bảo mật và cô lập đa người dùng
Đây là điểm đau lớn nhất. Năm 2021, tôi kiểm toán một dự án sử dụng GPU cloud của một nhà cung cấp nhỏ và phát hiện rằng các instance có thể bị tấn công side-channel. AWS đầu tư hàng tỷ đô la vào bảo mật vật lý và ảo hóa. Các đám mây mới nổi không có nguồn lực đó.
Contrarian: Tại sao tôi không nghĩ đây là cơ hội vĩnh cửu
Tôi từng chứng kiến mô hình tương tự trong DeFi: các giao thức mới nổi lên với lợi suất hấp dẫn, thu hút thanh khoản từ Uniswap, rồi biến mất khi thị trường thay đổi. Các nhà cung cấp GPU mới nổi đang tận dụng một khe cửa hẹp: sự khan hiếm tạm thời của H100 từ NVIDIA.
Nhưng một khi NVIDIA tăng sản lượng, hoặc AWS tung ra H200, lợi thế cạnh tranh của họ biến mất. Và khi đó, các startup AI sẽ quay lại AWS, không phải vì AWS tốt hơn, mà vì nó quen thuộc và đáng tin cậy hơn.
Bài học từ ICO 2017: Đừng chạy theo những gì chỉ có lợi thế ngắn hạn. Hãy nhìn vào cơ chế đồng thuận dài hạn. Trong trường hợp này, "cơ chế đồng thuận" là sự ổn định, bảo mật và hệ sinh thái mà AWS cung cấp.
Takeaway: Sự tiến bộ đến từ việc chọn đúng cuộc chơi
Sau sự sụp đổ của FTX, tôi đã dành 2 tuần để tự hỏi liệu lý tưởng của mình có đúng không. Cuối cùng, tôi hiểu ra: sự tiến bộ không đến từ việc chạy theo cơ hội, mà từ việc xây dựng trên nền tảng vững chắc.
Nếu bạn là một startup AI, hãy sử dụng các đám mây GPU mới nổi cho những tác vụ thử nghiệm, nhưng đừng đặt cược tương lai của mình vào chúng. Giống như trong crypto, chúng ta cần phân biệt giữa "cơ hội" và "cạm bẫy".
Và hãy nhớ: sau mỗi cơn mưa, trời lại sáng. Nhưng chỉ khi bạn có mái che vững chắc.