Les lois de mise à l’échelle rendent les grands modèles de langage plus prévisibles
En analysant 485 modèles issus de 40 familles, des chercheurs du MIT et du MIT-IBM Watson AI Lab proposent un cadre pour mieux anticiper les performances des grands modèles de langage. Leurs résultats montrent comment de petits modèles et leurs étapes d’entraînement intermédiaires peuvent orienter des choix techniques très coûteux.


