L'essor des petits modèles de langage : pourquoi plus grand n'est pas toujours mieux

À retenir : Les grands modèles de langage ont monopolisé l’attention en IA, mais une révolution discrète est en marche : les petits modèles de langage (SLM) prouvent que la taille n’est pas le seul critère. En misant sur des données de haute qualité et des architectures efficaces, les SLM peuvent égaler, voire surpasser, des modèles beaucoup plus volumineux sur des tâches spécifiques, tout en étant plus rapides, moins coûteux et en préservant la confidentialité. Pour la plupart des applications concrètes, tant professionnelles que grand public, la taille compte souvent.

 

Le problème des maquettes géantes

Les modèles de pointe comme GPT-4 et PaLM-2 contiennent des centaines de milliards, voire plus d'un billion, de paramètres. Leurs capacités sont extraordinaires, mais elles présentent des inconvénients majeurs. Ils nécessitent d'immenses centres de données, consomment des quantités astronomiques d'électricité et leur entraînement et leur maintenance sont onéreux. Selon une étude de 2022 menée par Hoffmann et al. chez DeepMind, de nombreux grands modèles sont sous-entraînés par rapport à leur taille, ce qui signifie que leurs performances pourraient être améliorées par de meilleures données plutôt que par un plus grand nombre de paramètres. Cette découverte, connue sous le nom de « lois d'échelle du chinchilla », a remis en question l'hypothèse selon laquelle les modèles plus grands sont automatiquement meilleurs.

Les entreprises et les développeurs sont également confrontés à des obstacles pratiques : coûts des API, latence, dépendance vis-à-vis des fournisseurs et problèmes de confidentialité des données. L’envoi de données clients sensibles à un mégamodèle distant peut s’avérer inacceptable pour les applications des secteurs de la santé, de la finance et du droit. C’est là que les modèles de langage légers prennent tout leur sens.

Que sont les petits modèles de langage ?

Les petits modèles de langage comportent généralement de quelques millions à quelques milliards de paramètres, soit jusqu'à 100 fois moins que les modèles de langage de pointe . On peut citer par exemple Phi 3 Mini de Microsoft (3.8 milliards de paramètres), Gemma de Google (2 milliards/7 milliards), Llama 3.2 de Meta (1 milliard/3 milliards) et le modèle open source TinyLlama (1.1 milliard). Malgré leur taille réduite, ces modèles sont étonnamment performants. Microsoft indique que Phi 3 Mini égale, voire surpasse, des modèles deux fois plus volumineux sur de nombreux tests de compréhension du langage, grâce à des données d'entraînement soigneusement sélectionnées et de qualité pédagogique, plutôt qu'à une extraction de données web aléatoire.

DistilBERT , une version allégée du modèle BERT de Google, en est un autre exemple . Il conserve 97 % de la compréhension du langage de BERT tout en étant 60 % plus rapide et 40 % plus léger. Il est donc idéal pour les applications en temps réel telles que la recherche et l'analyse des sentiments.

Pourquoi les maquettes ont le vent en poupe dans le monde réel
1. Rentabilité

Les petits modèles peuvent s'exécuter sur un seul GPU, voire un seul CPU, ce qui réduit considérablement les coûts d'inférence. Pour une entreprise traitant des millions de documents par jour, un modèle dont le coût est de quelques centimes par million de jetons est essentiel. Un appel API à un modèle linéaire généralisé (LLM) de grande envergure pourrait coûter 10 à 100 fois plus cher pour un résultat identique.

2. Vitesse et faible latence

Dans les chatbots, les assistants de programmation et les applications mobiles, les utilisateurs s'attendent à des réponses quasi instantanées. Les petits modèles génèrent des jetons beaucoup plus rapidement que leurs homologues plus volumineux, ce qui les rend idéaux pour une utilisation interactive.

3. Déploiement sur l'appareil et en périphérie

C’est peut-être là leur principal atout. Les modèles compacts peuvent fonctionner intégralement sur smartphones, ordinateurs portables et appareils embarqués, sans connexion Internet. Les modèles Foundation d’Apple et Gemini Nano de Google illustrent cette tendance. Ceci permet la traduction en temps réel, l’utilisation d’assistants hors ligne et une IA privée, intégrée à l’appareil, qui ne transfère jamais de données vers le cloud.

4. Confidentialité et sécurité

L'exécution locale d'un modèle garantit que les données sensibles (dossiers médicaux, documents financiers, photos personnelles) ne quittent jamais l'appareil. C'est un atout majeur pour les secteurs réglementés et les consommateurs soucieux de la protection de leur vie privée.

5. Personnalisation

Les petits modèles sont plus faciles à affiner sur des données spécifiques à un domaine. Un hôpital peut affiner un modèle 7B sur ses propres notes cliniques, obtenant ainsi une précision supérieure pour les tâches médicales par rapport à un modèle 175B généraliste qui possède des connaissances générales mais aucune connaissance spécifique.

L'avenir : la spécialisation plutôt que la surdimensionnement

D'après un rapport de Hugging Face datant de 2024 , les téléchargements de petits modèles open source progressent plus rapidement que ceux des grands modèles. Le cabinet d'analyse technologique Gartner prévoit que d'ici 2027, plus de 50 % des modèles d'IA générale utilisés en entreprise seront spécifiques à un domaine, contre moins de 1 % en 2023. Cela laisse penser que l'avenir de l'IA ne réside pas dans un cerveau unique et gigantesque, mais dans un réseau de modèles spécialisés et performants fonctionnant de concert.

Conclusion

L'essor des petits modèles de langage témoigne de la maturité de l'IA. Si les modèles de pointe continueront de repousser les limites du possible, les tâches pratiques en entreprise et dans la vie quotidienne seront de plus en plus souvent assurées par des modèles plus petits, plus rapides et plus respectueux de la vie privée. Dans les années à venir, les gagnants seront ceux qui sauront déployer le modèle adapté à la tâche, et non pas nécessairement le plus imposant.

Grace Wilson
À propos
est une blogueuse et conteuse de voyage passionnée. Animée par l'envie de voyager, elle crée des récits captivants sur des trésors cachés et des expériences authentiques à travers le monde. Ses écrits transportent les lecteurs, offrant des perspectives uniques et pratiques.... Conseils et enthousiasme contagieux. Rejoignez ses aventures pour des récits de voyage inspirants.