Investigação: A melhoria na eficiência do pré-treinamento de 2019 a 2025 deve-se principalmente aos dados
chaincatcherDwarkesh Patel e Jerry Han publicaram uma investigação em 8 de setembro de 2026, decompondo as contribuições dos dados e das melhorias dos modelos no progresso do pré-treinamento de 2019 a 2025. O estudo foi conduzido em menor escala, focando no pré-treinamento, correspondendo às receitas de modelos publicamente divulgadas e aos corpora de dados publicamente disponíveis para cada ano, e foi treinado numa escala computacional de até 1e19 FLOPs. Os resultados mostram que, sob o orçamento computacional de 1e19 FLOPs, o ganho de eficiência computacional proveniente das melhorias nos dados é de 12,0 vezes, enquanto as melhorias nos modelos produzem 3,7 vezes, sendo o ganho do lado dos dados aproximadamente 3,24 vezes o do lado do modelo. Os ganhos das melhorias nos dados e nos modelos são em grande parte independentes e interagem muito pouco, com o efeito aditivo de ambos explicando 88% da variância nas pontuações OLMES sob um modelo linear. No lado do modelo, a evolução do GPT-2 para o OLMo-2 abrange otimizadores, codificação posicional, normalização, funções de ativação e inicialização, entre outros. No lado dos dados, o corpus evoluiu de aproximadamente 9 mil milhões de tokens do OpenWebText em 2019 para corpora maiores e mais finamente filtrados, como o UltraFineWeb, em 2025.
Este conteúdo é apenas para fins informativos e educacionais e não constitui aconselhamento de investimento relacionado à BTCC. A BTCC envida todos os esforços, mas não pode garantir a veracidade, a precisão ou a originalidade do conteúdo acima.