بحث: التحسن في كفاءة التدريب المسبق من 2019 إلى 2025 يأتي بشكل أساسي من البيانات

chaincatcherchaincatcher
نشر دواريك باتيل وجيري هان بحثًا في 8 سبتمبر 2026، يحللان فيه مساهمات تحسينات البيانات والنماذج في تقدم التدريب المسبق من 2019 إلى 2025. أُجريت الدراسة على نطاق أصغر، مع التركيز على التدريب المسبق، بما يتوافق مع وصفات النماذج المنشورة علنًا ومجموعات البيانات المتاحة للجمهور لكل عام، وتم التدريب بمقياس حسابي يصل إلى 1e19 فلوب. تُظهر النتائج أنه في ظل ميزانية الحوسبة البالغة 1e19 فلوب، يبلغ الكسب في الكفاءة الحسابية من تحسينات البيانات 12.0 مرة، بينما تحسينات النماذج تحقق 3.7 مرات، مع كون كسب جانب البيانات أكبر بحوالي 3.24 مرة من جانب النموذج. إن المكاسب من تحسينات البيانات والنماذج مستقلة إلى حد كبير وتتفاعل بشكل ضئيل جدًا، حيث يفسر التأثير الإضافي لكليهما 88٪ من التباين في درجات OLMES في ظل نموذج خطي. على جانب النموذج، يشمل التطور من GPT-2 إلى OLMo-2 المُحسِّنات، والترميز الموضعي، والتطبيع، والدوال التنشيطية، والتهيئة، وغيرها. على جانب البيانات، تطورت المجموعة من حوالي 9 مليارات رمز من OpenWebText في 2019 إلى مجموعات أكبر وأكثر دقة في التصفية مثل UltraFineWeb بحلول 2025.

هذا المحتوى لأغراض معلوماتية وتعليمية فقط، ولا يمثل نصيحة استثمارية تتعلق بـ BTCC. تبذل BTCC قصارى جهدها ولكنها لا تضمن صحة أو دقة أو أصالة المحتوى المذكور أعلاه.