Recherche : L'amélioration de l'efficacité du pré-entraînement de 2019 à 2025 provient principalement des données

chaincatcherchaincatcher
Dwarkesh Patel et Jerry Han ont publié une recherche le 8 septembre 2026, décomposant les contributions des améliorations des données et des modèles dans les progrès du pré-entraînement de 2019 à 2025. L'étude a été menée à plus petite échelle, en se concentrant sur le pré-entraînement, correspondant aux recettes de modèles publiées et aux corpus de données disponibles publiquement pour chaque année, et a été entraînée à une échelle de calcul allant jusqu'à 1e19 FLOPs. Les résultats montrent que sous le budget de calcul de 1e19 FLOPs, le gain d'efficacité de calcul provenant des améliorations des données est de 12,0 fois, tandis que les améliorations des modèles produisent 3,7 fois, le gain côté données étant environ 3,24 fois celui du côté modèle. Les gains provenant des améliorations des données et des modèles sont en grande partie indépendants et interagissent très peu, l'effet additif des deux expliquant 88 % de la variance des scores OLMES sous un modèle linéaire. Côté modèle, l'évolution de GPT-2 à OLMo-2 englobe les optimiseurs, le codage positionnel, la normalisation, les fonctions d'activation et l'initialisation, entre autres. Côté données, le corpus a évolué d'environ 9 milliards de jetons d'OpenWebText en 2019 à des corpus plus volumineux et plus finement filtrés comme UltraFineWeb d'ici 2025.

Ce contenu est fourni à titre informatif et éducatif uniquement et ne constitue pas un conseil en investissement lié à BTCC. BTCC s’efforce de garantir la véracité, l’exactitude et l’originalité du contenu ci-dessus, sans pouvoir toutefois les garantir.