La bibliothèque 212AY
Glossaire
IA.
200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.
200 termes
Appel de fonctions
L'appel de fonctions permet aux LLM de produire du JSON structuré décrivant quelle fonction appeler. L'application exécute la fonction et renvoie le résultat. Cela comble le fossé entre compréhension du langage et actions réelles, permettant aux agents IA d'interagir avec des outils logiciels.
IA générative
L'IA générative désigne les systèmes d'IA qui créent du contenu nouveau — texte, images, code, musique ou vidéo — au lieu de simplement analyser ou classifier des données existantes. Les grands modèles de langage comme ChatGPT génèrent du texte ; les modèles de diffusion comme Midjourney créent des images ; les outils de code comme GitHub Copilot écrivent du logiciel. L'IA générative transforme la création, le service client, le développement logiciel et l'éducation, bien qu'elle pose des questions importantes sur l'originalité, le droit d'auteur et la désinformation.
GPT
GPT est une famille de grands modèles de langage d'OpenAI utilisant l'architecture transformer. De GPT-1 en 2018 à GPT-4, chaque génération a apporté des améliorations spectaculaires. Les modèles GPT alimentent ChatGPT et sont accessibles via API. La série a démontré que l'échelle produit des capacités émergentes.
GPU (unité de traitement graphique)
Un GPU est un processeur spécialisé initialement conçu pour le graphisme mais devenu essentiel pour l'IA car il peut effectuer des milliers d'opérations mathématiques en parallèle, exactement ce que nécessitent l'entraînement et l'inférence des réseaux de neurones. Entraîner un grand modèle uniquement sur des CPU pourrait prendre des mois ; le même modèle sur GPU termine en jours ou heures. NVIDIA domine le marché des GPU pour l'IA avec son écosystème CUDA, et des fournisseurs cloud comme AWS et Google Cloud louent des capacités GPU à l'heure.
Descente de gradient
La descente de gradient est l'algorithme d'optimisation qui minimise la fonction de perte d'un modèle en ajustant itérativement les poids dans la direction qui réduit le plus l'erreur. C'est comme un randonneur dans des montagnes brumeuses cherchant la vallée la plus basse : à chaque pas, il sent la pente et descend. Le taux d'apprentissage contrôle l'amplitude du pas. Des variantes comme SGD et Adam adaptent le processus pour l'efficacité. Tout entraînement de réseau de neurones repose fondamentalement sur la descente de gradient.
Ancrage (grounding)
L'ancrage est la technique qui ancre les réponses d'un modèle de langage dans des données vérifiables du monde réel plutôt que de se fier uniquement aux connaissances d'entraînement. Le RAG est la méthode la plus courante : le modèle récupère des documents pertinents avant de répondre. L'ancrage réduit les hallucinations, maintient l'actualité des réponses et fournit des citations. Un assistant juridique marocain ancré dans le journal officiel peut citer des articles exacts, tandis qu'un assistant non ancré pourrait inventer des références juridiques plausibles mais fausses.
Hallucination
Une hallucination est quand un modèle de langage génère un texte fluide et plausible mais factuellement incorrect ou fabriqué — affirmant des choses qui ne se sont jamais produites, citant des sources inexistantes ou confondant des détails. Les hallucinations surviennent car les modèles optimisent pour le prochain token le plus probable, pas pour la vérité. Un assistant juridique hallucinant une jurisprudence pourrait mettre un cabinet en grave difficulté. Les stratégies d'atténuation incluent l'ancrage RAG, des couches de vérification, la réduction de température et la revue humaine.
Réglage des hyperparamètres
Le réglage des hyperparamètres consiste à sélectionner la configuration optimale d'un modèle de machine learning avant le début de l'entraînement — paramètres comme le taux d'apprentissage, la taille des lots, le nombre de couches et le taux de dropout. Contrairement aux paramètres internes que l'algorithme apprend seul, les hyperparamètres sont fixés par le praticien. La recherche par grille, la recherche aléatoire et l'optimisation bayésienne sont des méthodes courantes. De bons hyperparamètres font la différence entre un modèle à peine fonctionnel et un modèle performant.
Classification d'images
La classification d'images est la tâche d'attribuer une étiquette ou catégorie à une image entière selon son contenu visuel. Un modèle entraîné sur des milliers de photos étiquetées apprend à distinguer chats de chiens, produits défectueux de bons, radiographies saines de malades. Les CNN et vision transformers sont les architectures standard. La classification d'images alimente le contrôle qualité en usine, l'aide au diagnostic médical et la modération de contenu.