# 1. Les bases du LLM ## LLM (grand modèle de langage) Un programme entraîné sur d'immenses quantités de texte pour prédire, mot après mot, la suite la plus probable d'un texte donné. C'est cette capacité de prédiction, affinée à très grande échelle, qui produit des réponses qui semblent comprendre et raisonner. > INFO : « grand » fait référence au nombre de paramètres internes du modèle (souvent plusieurs milliards) — pas à sa taille en gigaoctets sur disque ni à la quantité de texte qu'il peut traiter en une fois (voir « Fenêtre de contexte » plus bas, une notion différente). ## Token L'unité de base que le modèle manipule — souvent un mot, parfois un morceau de mot ou un seul caractère. Un texte est toujours découpé en tokens avant d'être traité ; c'est aussi l'unité utilisée pour mesurer la longueur d'une conversation ou le coût d'une requête. > ASTUCE : en français comme en anglais, un token correspond en moyenne à un peu moins d'un mot entier — un texte de 100 mots représente généralement autour de 130 à 150 tokens. Utile pour estimer rapidement si un document tiendra dans une fenêtre de contexte donnée. ## Fenêtre de contexte La quantité maximale de texte (mesurée en tokens) qu'un modèle peut « voir » en même temps pour produire sa réponse — la conversation entière, les documents fournis, ses propres réponses précédentes. Au-delà de cette limite, les éléments les plus anciens ne sont simplement plus visibles du modèle. > INFO : une fenêtre de contexte large ne rend pas un modèle plus intelligent — elle détermine seulement combien d'information il peut prendre en compte simultanément. Un modèle avec une petite fenêtre peut très bien raisonner sur ce qu'il voit ; il voit juste moins à la fois. ## Prompt Le texte d'entrée fourni au modèle — la question ou l'instruction de l'utilisateur, mais aussi, en coulisses, les consignes de configuration données par l'application qui utilise le modèle (voir « prompt système » dans la section suivante). ## Température Un réglage qui contrôle le degré de hasard dans le choix des mots suivants : une température basse produit des réponses plus prévisibles et répétitives, une température élevée produit des réponses plus variées mais aussi potentiellement moins cohérentes. Ce réglage est généralement choisi par l'application, pas par l'utilisateur final. *(Schéma disponible : `schema.svg`, dans ce dossier.)*