La bibliothèque 212AY

Glossaire
IA.

200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.

200 termes

Infrastructure IA

Kubernetes

Kubernetes est une plateforme open source qui déploie, met à l'échelle et gère automatiquement des applications conteneurisées sur de nombreux serveurs. Pour les équipes IA, c'est la machinerie qui maintient les modèles en production : si un service de détection de fraude bancaire reçoit soudain dix fois plus de trafic, Kubernetes lance des copies supplémentaires ; si un serveur tombe, il redémarre la charge ailleurs. C'est un chef des opérations logiciel qui surveille, remplace et rééquilibre en permanence.

Outils & Plateformes

LangChain

LangChain est un framework open source pour construire des applications alimentées par des modèles de langage. Il fournit des composants modulaires pour enchaîner prompts, systèmes de récupération, outils et mémoire. Un développeur à Casablanca peut utiliser LangChain pour connecter un LLM aux documents, base de données et API d'une entreprise.

LLM & Modèles

Grand modèle de langage (LLM)

Un grand modèle de langage est un réseau de neurones entraîné sur des billions de tokens textuels capable de générer, comprendre et manipuler le langage humain avec une fluidité remarquable. GPT-4, Claude, Gemini et Llama en sont des exemples majeurs. Les LLM alimentent les chatbots, assistants de code, outils de traduction, résumés et écriture créative. Leur polyvalence vient de l'échelle : plus de paramètres et plus de données produisent des capacités émergentes comme le raisonnement et la génération de code, bien qu'ils hallucinent encore.

Deep Learning

Espace latent

L'espace latent est la représentation compressée et abstraite des données apprise par un réseau de neurones — un espace de dimensionnalité inférieure où les caractéristiques significatives sont encodées. Dans un espace latent bien entraîné, les entrées similaires sont proches et l'interpolation produit des transitions sémantiquement significatives. Les auto-encodeurs et VAE en apprennent explicitement ; les GAN et modèles de diffusion en échantillonnent pour générer de nouvelles données.

Deep Learning

Normalisation par couche

La normalisation par couche standardise les entrées sur toutes les caractéristiques d'un seul exemple d'entraînement, plutôt que sur le lot. Elle stabilise et accélère l'entraînement en maintenant les activations à des échelles cohérentes, et est un composant clé des architectures transformer. Contrairement à la normalisation par lots, elle fonctionne de la même façon quelle que soit la taille du lot.

Fondamentaux

Classement (leaderboard)

Un classement est un rang public de modèles ou systèmes d'IA basé sur leur performance sur des benchmarks standardisés. Des sites comme le Hugging Face Open LLM Leaderboard classent les modèles par scores. Les classements stimulent la compétition et la transparence, mais optimiser pour eux peut mener au surapprentissage aux benchmarks.

Fondamentaux

Taux d'apprentissage

Le taux d'apprentissage est un hyperparamètre contrôlant l'ampleur de l'ajustement des poids du modèle lors de chaque mise à jour. Trop élevé, le modèle diverge ; trop bas, l'entraînement est lent ou se bloque. Trouver le bon taux est l'une des étapes les plus importantes, souvent guidé par des schedules qui décroissent avec le temps.

LLM & Modèles

LLaMA

LLaMA est une famille de grands modèles de langage open source développés par Meta. Disponibles de 7B à 70B+ paramètres, les modèles LLaMA peuvent être librement utilisés et modifiés, ce qui en fait un choix populaire pour les entreprises voulant faire tourner l'IA localement. LLaMA a engendré de nombreuses variantes fine-tunées comme Alpaca, Vicuna et Code Llama.

LLM & Modèles

LoRA (adaptation à faible rang)

LoRA est une méthode de fine-tuning à faible coût qui gèle les poids originaux du modèle et injecte de petites matrices entraînables dans chaque couche, réduisant drastiquement la mémoire et le calcul nécessaires. Au lieu de mettre à jour des milliards de paramètres, on n'en entraîne que quelques millions, rendant l'adaptation de modèles abordable sur des GPU grand public. Une startup marocaine peut affiner un LLM open source sur des données clients darija avec un seul GPU au lieu d'un cluster coûteux.