La bibliothèque 212AY

Glossaire
IA.

200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.

200 termes

LLM & Modèles

Modèle de base

Un modèle de base est un grand modèle de langage entraîné sur d'immenses volumes de texte pour prédire le prochain token, mais qui n'a pas encore été affiné pour des tâches spécifiques ni aligné sur les préférences humaines. C'est un talent brut : excellent pour compléter du texte mais pas encore formé à suivre des instructions poliment ou à refuser des demandes nocives. Les modèles de base servent de point de départ pour créer des chatbots et assistants via des étapes supplémentaires comme l'instruction tuning et le RLHF.

Deep Learning

Normalisation par lots

La normalisation par lots est une technique qui standardise les entrées de chaque couche d'un réseau de neurones pendant l'entraînement, maintenant stable la distribution des données au fur et à mesure qu'elles traversent le réseau. Cela accélère considérablement l'entraînement, permet des taux d'apprentissage plus élevés et agit comme un régularisateur léger. Sans elle, les réseaux profonds sont sujets au décalage de covariable interne, où chaque couche doit constamment s'adapter à des distributions d'entrée changeantes.

Fondamentaux

Taille de lot

La taille de lot est le nombre d'exemples traités ensemble avant la mise à jour des poids. Les petits lots utilisent moins de mémoire mais s'entraînent lentement ; les grands lots sont plus rapides avec le parallélisme GPU. Les valeurs typiques vont de 16 à 512.

Fondamentaux

Jalon (benchmark)

Un jalon est un test standardisé ou un jeu de données utilisé pour mesurer et comparer la performance de modèles d'IA sur des tâches spécifiques. C'est l'examen final que chaque modèle passe dans les mêmes conditions. Les jalons courants incluent MMLU pour les connaissances générales, HumanEval pour le code et GLUE pour la compréhension du langage. Ils aident les chercheurs et les entreprises à choisir le bon modèle, mais ils ont leurs limites : un modèle excellent sur un jalon peut échouer sur des données réelles désordonnées.

LLM & Modèles

BERT

BERT (Bidirectional Encoder Representations from Transformers) est un modèle de langage fondamental qui lit le texte dans les deux sens simultanément, permettant une compréhension du contexte plus profonde. Publié par Google en 2018, il a lancé l'ère moderne des modèles de langage pré-entraînés et excelle en classification, question-réponse et reconnaissance d'entités nommées. Son architecture a influencé GPT, RoBERTa et de nombreux successeurs.

Fondamentaux

Compromis biais-variance

Le compromis biais-variance décrit l'équilibre qu'un modèle doit trouver entre être trop simple (biais élevé, sous-ajustement) et trop complexe (variance élevée, surapprentissage). Un modèle à biais élevé rate des motifs réels, comme un étudiant qui ne lit que les résumés et échoue aux questions nuancées. Un modèle à variance élevée mémorise le bruit des données d'entraînement et échoue sur de nouvelles entrées, comme un étudiant qui apprend par cœur sans comprendre. Le bon modèle se situe au juste milieu.

Traitement du langage

Score BLEU

BLEU est une métrique automatique mesurant la similarité entre un texte généré par machine et des traductions humaines de référence, basée sur le chevauchement de n-grams, avec un score de 0 à 1. Largement utilisé pour évaluer la traduction automatique, BLEU a des limites connues : il ne capture pas le sens et pénalise les reformulations valides. Il reste un baseline utile malgré ses défauts.

LLM & Modèles

BPE

BPE est un algorithme de tokenisation qui fusionne itérativement les paires de tokens les plus fréquentes. Il équilibre la tokenisation au niveau mot et au niveau caractère. Utilisé par GPT, Llama et la plupart des modèles modernes, il gère l'anglais, le français, l'arabe et le code.

Deep Learning

Oubli catastrophique

L'oubli catastrophique se produit quand un réseau de neurones perd sa capacité à accomplir une tâche apprise après avoir été affiné sur une tâche nouvelle, car le nouvel entraînement écrase les poids originaux. C'est un défi majeur de l'apprentissage continu. La consolidation élastique des poids et les tampons de répétition atténuent ce phénomène.