Cuộc chiến AI không được định đoạt bởi 'hạng cân'
Lý do bảng xếp hạng AI bị đảo lộn. Một công ty khởi nghiệp của Hàn đã vượt qua các tập đoàn lớn.
Một mô hình AI được phát triển bởi công ty khởi nghiệp Motif Technologies đã đạt kết quả vượt trội đáng kể so với các mô hình AI quy mô lớn của LG AI Research và SK Telecom trong một đợt đánh giá hiệu năng toàn cầu.
Những kết quả này không đến từ các cuộc tự đánh giá nhằm mục đích quảng bá. Thay vào đó, chúng là các chỉ số được ghi nhận trong giai đoạn hai của dự án "Mô hình nền tảng AI độc lập" (Dokpamo), một sáng kiến nhằm lựa chọn mô hình AI "nhà vô địch quốc gia" của Hàn Quốc có khả năng cạnh tranh với các mô hình tiên tiến nhất từ Mỹ và Trung Quốc.
Vòng đánh giá thứ hai của chương trình "Dokpamo" được chấm trên thang điểm tối đa là 100. Trong đó, các bài kiểm tra chuẩn (benchmark) đo lường hiệu suất mô hình thông qua các chỉ số định lượng chiếm 40 điểm, đánh giá của chuyên gia chiếm 35 điểm và đánh giá của người dùng chiếm 25 điểm. Đối với 40 điểm từ các bài kiểm tra chuẩn, 15 điểm do Cơ quan Xã hội Thông tin Quốc gia (NIA) đánh giá, trong khi 25 điểm còn lại dựa trên "Chỉ số Trí tuệ (AAII)" của Artificial Analysis, một công ty đánh giá AI toàn cầu.
Chính phủ đã ủy quyền cho Artificial Analysis thực hiện một đợt đánh giá riêng cho vòng hai này và kết quả đã được công bố. Quá trình đánh giá bao gồm các mô hình mới nhất từ bốn đội đang tranh tài tại Dokpamo: SK Telecom, LG AI Research, Upstage và Motif Technologies.
Một công ty khởi nghiệp vượt qua các tập đoàn lớn
Kết quả mang lại nhiều bất ngờ. Mô hình "Motif 3" của Motif Technologies đạt điểm cao nhất, với 47 điểm. Theo sau là "Solar Open 2" của Upstage (37 điểm), "A.X K2" của SK Telecom (35 điểm) và "K-Exaone 2.0" của LG AI Research (31 điểm).
Sự thay đổi này phản ánh các tiêu chuẩn cạnh tranh đang biến chuyển trên thị trường AI. Nếu như trước đây, khả năng giải các bài toán khó hay sở hữu kho kiến thức khổng lồ từng là yếu tố then chốt, thì ngày nay, lợi thế cạnh tranh cốt lõi lại nằm ở hiệu quả thực hiện các tác vụ thực tế của AI. Trọng tâm đã chuyển dịch từ việc chỉ soạn thảo email hay báo sang năng lực của "tác nhân AI" (AI agent): Khả năng tìm kiếm dữ liệu, thực thi chương trình, lựa chọn công cụ cần thiết và hoàn tất các quy trình gồm nhiều bước.

Không chỉ là vấn đề về quy mô (số lượng tham số)
Đợt đánh giá thứ hai do Dokpamo thực hiện đã phản ánh xu hướng này. K-Exaone 2.0 là một mô hình khổng lồ với khoảng 750 tỷ (750B) tham số, và A.X K2 cũng sở hữu quy mô lên tới 688 tỷ tham số. Motif 3 và Solar Open 2 lần lượt có 314 tỷ và 250 tỷ tham số.
Hiểu một cách đơn giản, tham số là vô số các giá trị số mà AI tự điều chỉnh trong quá trình học. Thông thường, số lượng tham số càng lớn thì mô hình càng có khả năng lưu trữ nhiều thông tin và xử lý các vấn đề phức tạp tốt hơn. Trong quá trình phát triển, LG AI Research đã đầu tư nguồn lực đáng kể để mở rộng quy mô mô hình. Họ xác định rằng để cạnh tranh với các AI hàng đầu thế giới về lâu dài, trước tiên họ cần xây dựng một "cỗ máy" (hay "vỏ chứa") đủ lớn. Tuy nhiên, do dành quá nhiều công sức cho việc mở rộng quy mô và ổn định mô hình trong một khoảng thời gian hạn hẹp, dường như họ còn lại rất ít thời gian cho giai đoạn hậu huấn luyện (post-training) và tối ưu hóa hiệu suất tác nhân.
Hậu huấn luyện là quá trình tinh chỉnh mô hình, sau khi quá trình huấn luyện ban đầu đã hoàn tất, để phù hợp với các trường hợp sử dụng cụ thể trong thực tế. Nếu tiền huấn luyện (pre-training) giống như việc học các kiến thức cơ bản của nhiều môn học ở trường, thì hậu huấn luyện bao gồm việc tinh chỉnh phong cách phản hồi và huấn luyện chuyên sâu cho mô hình về khả năng suy luận, lập trình cũng như sử dụng công cụ để triển khai dịch vụ thực tế.
Tất nhiên, chỉ số này không quyết định năng lực cạnh tranh cuối cùng của một mô hình. Đây chỉ là một trong nhiều chỉ số đánh giá, và điểm số cao không đảm bảo hiệu suất tổng thể. Hiệu suất được định hình bởi nhiều yếu tố như trình độ tiếng Hàn, trải nghiệm người dùng thực tế, chi phí, hiệu quả, độ an toàn và chuyên môn đặc thù ngành, những yếu tố không thể được phản ánh đầy đủ chỉ qua một chỉ số duy nhất.


