Trustinel
Blockchain

Grok 4.6 đứng thứ 3 về AI y tế: Chiến thắng benchmark hay ảo tưởng marketing?

Hoàng Phúc
Tuần trước, tôi đọc được một tin từ Crypto Briefing: Grok 4.6 của xAI vừa đứng thứ 3 trong bảng xếp hạng Artificial Analysis Healthcare and Medical Index. Một con số đẹp, nhưng nếu bạn từng mất tiền vì ICO như tôi năm 2017, bạn sẽ biết rằng những thứ hào nhoáng thường che giấu sự thật. Tôi đã dành 11 năm để quan sát ngành này, và tôi biết rằng một bảng xếp hạng mà không có điểm số cụ thể, không có phương pháp luận chi tiết, chẳng khác nào một lời hứa suông. Câu hỏi đặt ra: liệu Grok 4.6 có thực sự giỏi y tế, hay chỉ là kết quả của một chiến dịch PR được thiết kế tinh vi? Hãy bắt đầu với bối cảnh. xAI, công ty AI của Elon Musk, đã gây chú ý với dòng Grok – một mô hình ngôn ngữ lớn được quảng bá là “tìm kiếm sự thật tối đa”. Nhưng Grok nổi tiếng với việc ít bị ràng buộc về mặt an toàn hơn so với các đối thủ như GPT-4 hay Claude. Khi tôi làm việc với các DAO trong lĩnh vực AI phi tập trung, tôi thấy rằng các mô hình dễ bị “jailbreak” thường được ưa chuộng bởi cộng đồng crypto, nhưng trong y tế, điều đó là một thảm họa tiềm tàng. Bảng xếp hạng Artificial Analysis thường dựa trên các bài kiểm tra kiến thức y khoa dạng hỏi-đáp, như MedQA. Những bài kiểm tra này có thể bị “luyện” bằng cách tinh chỉnh dữ liệu hoặc điều chỉnh phần thưởng trong quá trình RLHF. Điều này có nghĩa là Grok 4.6 có thể đạt điểm cao mà không thực sự hiểu y học – giống như một sinh viên học tủ để thi. Cốt lõi của vấn đề nằm ở kỹ thuật. Dựa trên kinh nghiệm audit của tôi, tôi biết rằng các mô hình như Grok thường sử dụng kiến trúc Mixture of Experts (MoE). Nhưng Grok 4.6 cụ thể ra sao? Không ai biết. xAI không công bố tham số, không tiết lộ dữ liệu huấn luyện, không đưa ra điểm số chi tiết. Tất cả những gì chúng ta có là một dòng tweet hoặc một bài báo từ Crypto Briefing – một trang tin chuyên về tiền điện tử, vốn nổi tiếng với việc đưa tin theo hướng “câu view”. Nếu bạn nhìn vào lịch sử của Grok, từ phiên bản 1 đến 2, mô hình này luôn yếu hơn GPT-4 trong các bài kiểm tra y tế. Vậy làm thế nào Grok 4.6 lại đột nhiên vươn lên top 3? Câu trả lời có thể là: xAI đã tối ưu hóa mô hình riêng cho bộ benchmark này. Đây là một hiện tượng phổ biến trong ngành – được gọi là “benchmark overfitting”. Khi một công ty biết trước các câu hỏi kiểm tra, họ có thể huấn luyện mô hình để trả lời chính xác, nhưng nếu đưa ra một tình huống lâm sàng ngoài phạm vi, mô hình sẽ thất bại thảm hại. Nhưng hãy đi ngược lại với lẽ thường. Nhiều người sẽ nói: “Đứng thứ 3 là tốt rồi, ít nhất nó cũng chứng tỏ Grok có năng lực.” Tôi không phủ nhận điều đó hoàn toàn. Nếu Grok 4.6 thực sự có khả năng trả lời các câu hỏi y khoa chính xác, nó có thể hữu ích trong việc hỗ trợ nghiên cứu hoặc giáo dục. Nhưng vấn đề là y tế không phải là một bài kiểm tra. Nếu một bác sĩ dựa vào Grok để chẩn đoán, và mô hình đưa ra lời khuyên sai lầm – ví dụ như khuyên bệnh nhân dùng thuốc có hại – hậu quả sẽ là tính mạng con người. Và đây là điểm mù: Grok nổi tiếng với việc từ chối kiểm duyệt. Elon Musk từng tuyên bố rằng Grok “ít bị hạn chế hơn” để thúc đẩy sự thật. Nhưng trong y tế, một mô hình không biết nói “tôi không biết” là một mối nguy hiểm. Tôi đã từng chứng kiến các dự án DeFi sụp đổ chỉ vì thiếu cơ chế an toàn – và AI y tế cũng vậy. Một bảng xếp hạng cao không có nghĩa là mô hình an toàn; nó thậm chí có thể là dấu hiệu của việc hy sinh an toàn để đạt điểm cao. Cuối cùng, tôi muốn nhấn mạnh một điều: chúng ta đang sống trong một thị trường tăng, nơi mọi thứ đều được tô hồng. Nhưng tôi đã học được từ những ngày đầu của blockchain rằng giá trị thực sự đến từ sự minh bạch và trách nhiệm. Grok 4.6 có thể là một bước tiến, nhưng nếu xAI không công bố chi tiết kỹ thuật, không đưa ra các bài kiểm tra an toàn độc lập, thì tôi sẽ không bao giờ tin tưởng nó trong một bối cảnh y tế. Hãy nhìn vào bài học từ SmartMesh năm 2017: những lời hứa lớn thường đi kèm với rủi ro lớn. Và như một người truyền giáo cho phi tập trung, tôi tin rằng sự thật phải được xây dựng trên bằng chứng, không phải trên bảng xếp hạng.