LIÊN HỆ HOTLINE/ZALO: 0981.243.678

Arena đạt định giá 3,1 tỷ USD sau vòng gọi vốn 200 triệu USD
Nền tảng đánh giá mô hình AI Arena vừa huy động 200 triệu USD, nâng định giá lên 3,1 tỷ USD và bổ sung tiêu chí đo lường độ trung thực của AI.
Nền tảng Arena, đơn vị vận hành bảng xếp hạng mô hình ngôn ngữ lớn quen thuộc LMArena, vừa công bố hoàn tất vòng gọi vốn Series B trị giá 200 triệu USD, nâng mức định giá doanh nghiệp lên mốc 3,1 tỷ USD.
Thương vụ diễn ra sau khi công ty ghi nhận doanh thu định kỳ quy năm (ARR – annualized run-rate revenue) chạm mốc 100 triệu USD vào tháng 6 vừa qua. Vòng đầu tư do hai quỹ Lightspeed Venture Partners và Khosla Ventures dẫn dắt, cùng sự tham gia của Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz (a16z) và Felicis.

Định giá tăng gần gấp đôi trong chưa đầy một năm
Vào tháng 1, Arena từng công bố vòng Series A quy mô 150 triệu USD với mức định giá sau đầu tư là 1,7 tỷ USD cùng doanh thu định kỳ quy năm đạt 30 triệu USD. Như vậy, chỉ trong vòng khoảng 10 tháng, giá trị của startup công nghệ này đã tăng gần gấp đôi.
Khởi nguồn từ một dự án nghiên cứu tại Đại học California, Berkeley (UC Berkeley) vào năm 2023, Arena vận hành theo phương thức thu thập đánh giá cộng đồng (crowdsourcing) hoàn toàn miễn phí cho người dùng phổ thông. Người dùng nhập câu lệnh (prompts), so sánh kết quả trả về từ hai mô hình ẩn danh và bình chọn bên thể hiện tốt hơn. Nền tảng hiện ghi nhận hàng chục triệu lượt truy cập mỗi tháng.
Lời giải thương mại cho bài toán gian lận điểm chuẩn
Tháng 9 năm ngoái, Arena ra mắt sản phẩm thương mại AI Evaluations, cung cấp dịch vụ phân tích hiệu năng chuyên sâu cho các phòng lab phát triển và khối doanh nghiệp dựa trên phản hồi thực tế từ cộng đồng.
Giải pháp này xuất hiện đúng thời điểm các bài kiểm tra điểm chuẩn tĩnh (static benchmarks) bộc lộ nhiều lỗ hổng. Nhiều phòng lab AI nhận ra mô hình có xu hướng học mẹo để vượt qua các bài kiểm tra chuẩn hóa nhằm đạt điểm số cao mà không thực sự cải thiện năng lực thực tế. Song song đó, các doanh nghiệp cần dữ liệu kiểm thử thực tế để lựa chọn mô hình phù hợp nhất với hạ tầng nội bộ thay vì phụ thuộc vào các chỉ số lý thuyết.
Đại diện Arena nhấn mạnh trong thông cáo gọi vốn rằng công nghệ đang tiến nhanh hơn năng lực đánh giá, đồng thời thị trường cần một bên thứ ba độc lập để đo lường mức độ an toàn và căn chỉnh (AI alignment) khi mô hình vận hành trong tay người dùng thực.
Bổ sung tiêu chí đo lường hành vi gian dối của AI
Để giải quyết bài toán an toàn, Arena đã tích hợp thêm hạng mục đánh giá mới mang tên căn chỉnh (alignment) trên bảng xếp hạng. Danh mục này tập trung chấm điểm các hành vi rủi ro cụ thể:
- Hành động trái phép (unauthorized action): Mô hình tự ý thực hiện các tác vụ không được yêu cầu.
- Gán nguồn sai lệch (false attribution): Trích dẫn sai sự thật hoặc gán phát ngôn không chính xác cho nguồn tin.
- Hoàn thành giả tạo (deceptive completion): Báo cáo đã hoàn thành nhiệm vụ dù thực tế chưa thực hiện.
Ở bảng xếp hạng căn chỉnh sơ bộ hiện tại, các mô hình của OpenAI đang chiếm lĩnh các vị trí dẫn đầu, trong khi các phiên bản Claude Opus 5.5 và Claude Fable lần lượt giữ vị trí thứ 6 và thứ 9.
Nguồn: TechCrunch

Liên hệ qua Zalo