Qu’est-ce qu’un modèle de langage ?
Un modèle de langage est un programme capable de comprendre et de générer du texte en langue naturelle. Il est entraîné sur d’immenses quantités de textes (livres, articles, pages web, code source…) afin d’apprendre les structures, les patterns et les relations entre les mots d’une langue. L’objectif fondamental d’un modèle de langage est simple : prédire la suite d’un texte. Donnez-lui le début d’une phrase, et il vous propose la continuation la plus probable.Comment un LLM prédit le prochain mot
Imaginons que vous écriviez : “La capitale de la France est…”. Le modèle analyse tous les mots qui précèdent et calcule une distribution de probabilités sur les mots susceptibles de suivre. Dans ce cas, le mot “Paris” obtient une probabilité très élevée, tandis que “banane” en obtient une quasi nulle. Ce mécanisme de prédiction est répété token par token (nous verrons ce concept dans la prochaine leçon), jusqu’à former une réponse complète. En apparence, cela peut ressembler à de la compréhension, mais il s’agit fondamentalement d’un calcul statistique extrêmement sophistiqué.Un LLM ne “sait” pas que Paris est la capitale de la France au sens où un humain le sait. Il a appris que, dans des millions de textes, le mot “Paris” suit très fréquemment l’expression “capitale de la France”. Cette distinction est cruciale pour comprendre les limites des modèles.
L’architecture Transformer
La quasi-totalité des LLM modernes repose sur une architecture appelée Transformer, introduite par Google en 2017 dans l’article “Attention Is All You Need”. Voici ses concepts clés, expliqués simplement : Le mécanisme d’attention permet au modèle de “regarder” l’ensemble du texte en entrée simultanément, plutôt que de le lire mot par mot. Il peut ainsi établir des relations entre des mots éloignés dans une phrase : dans “La banque sur laquelle il s’est assis se trouvait près de la rivière”, le modèle comprend que “banque” désigne un banc, et non un établissement financier, grâce au contexte fourni par “rivière”. Les couches et les paramètres sont les “neurones” du modèle. Un LLM comme GPT-4 possède des centaines de milliards de paramètres : des valeurs numériques ajustées lors de l’entraînement pour encoder les connaissances du modèle. Le contexte (ou fenêtre de contexte) est la quantité de texte que le modèle peut “voir” à la fois lors de la génération d’une réponse. Plus la fenêtre est grande, plus le modèle peut tenir compte d’informations passées dans la conversation.Les LLM populaires
Aujourd’hui, plusieurs grands modèles se distinguent par leurs performances et leurs caractéristiques propres.GPT-4 / GPT-4o
Développé par OpenAI, GPT-4 est l’un des modèles les plus puissants et polyvalents. GPT-4o intègre texte, images et audio dans un seul modèle multimodal.
Claude
Développé par Anthropic, Claude est réputé pour ses longues fenêtres de contexte, sa capacité de raisonnement et son alignement sur des valeurs de sécurité.
Gemini
Développé par Google DeepMind, Gemini est nativement multimodal et profondément intégré à l’écosystème Google (Search, Workspace, etc.).
Mistral & Llama
Mistral (français) et Llama (Meta) sont des modèles open-source ou à poids ouverts, particulièrement appréciés pour leur déploiement local et leur transparence.
