Nghiên cứu: Cải thiện hiệu quả tiền huấn luyện từ 2019 đến 2025 chủ yếu đến từ dữ liệu

chaincatcherchaincatcher
Dwarkesh Patel và Jerry Han đã công bố nghiên cứu vào ngày 8 tháng 9 năm 2026, phân tích những đóng góp của dữ liệu và cải tiến mô hình trong tiến trình tiền huấn luyện từ năm 2019 đến 2025. Nghiên cứu được thực hiện ở quy mô nhỏ hơn, tập trung vào tiền huấn luyện, tương ứng với các công thức mô hình được công bố công khai và các kho dữ liệu công khai có sẵn cho mỗi năm, và được huấn luyện ở quy mô tính toán lên tới 1e19 FLOPs. Kết quả cho thấy, dưới ngân sách tính toán 1e19 FLOPs, mức tăng hiệu quả tính toán từ cải tiến dữ liệu là 12,0 lần, trong khi cải tiến mô hình mang lại 3,7 lần, với mức tăng từ phía dữ liệu xấp xỉ 3,24 lần so với phía mô hình. Lợi ích từ cải tiến dữ liệu và mô hình phần lớn là độc lập và tương tác rất ít, với hiệu ứng cộng gộp của cả hai giải thích 88% phương sai trong điểm OLMES dưới mô hình tuyến tính. Về phía mô hình, sự tiến hóa từ GPT-2 đến OLMo-2 bao gồm các bộ tối ưu hóa, mã hóa vị trí, chuẩn hóa, hàm kích hoạt và khởi tạo, cùng nhiều yếu tố khác. Về phía dữ liệu, kho ngữ liệu đã phát triển từ khoảng 9 tỷ token của OpenWebText vào năm 2019 đến các kho ngữ liệu lớn hơn và được lọc tinh vi hơn như UltraFineWeb vào năm 2025.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.