La bibliothèque 212AY
Glossaire
IA.
200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.
200 termes
Compression de modèle
La compression de modèle regroupe des techniques qui réduisent la taille et les exigences de calcul d'un réseau de neurones entraîné tout en préservant la précision. Méthodes : quantization, élagage, distillation de connaissances et factorisation à faible rang. La compression rend possible le déploiement de modèles performants sur smartphones et appareils périphériques.
Optimisation de modèle
L'optimisation de modèle regroupe des techniques améliorant l'efficacité d'un modèle entraîné — réduisant la latence, l'utilisation mémoire et le coût de calcul — sans dégrader significativement la qualité des prédictions. Méthodes : quantization, élagage, distillation, fusion d'opérateurs, optimisation de graphe. L'optimisation est cruciale pour le déploiement à l'échelle : un modèle à 2 secondes par prédiction peut être réduit à 50 millisecondes pour devenir exploitable en production.
Registre de modèles
Un registre de modèles est un système centralisé pour suivre et gérer les modèles d'IA tout au long de leur cycle de vie — du développement au déploiement en production. Il stocke les versions, métadonnées d'entraînement, métriques, statut d'approbation et historique de déploiement. MLflow, AWS SageMaker et Vertex AI fournissent des implémentations populaires. Le registre est essentiel pour la gouvernance et la conformité.
Service de modèle
Le service de modèle est le processus de déploiement d'un modèle d'IA entraîné derrière un endpoint API pour que les applications puissent envoyer des requêtes et recevoir des prédictions en temps réel. Il implique le batching des requêtes pour l'efficacité GPU, la gestion de versions, la montée en charge et la surveillance de latence. NVIDIA Triton, TensorFlow Serving, BentoML et vLLM fournissent des infrastructures de service prêtes pour la production.
IA multimodale
L'IA multimodale désigne des modèles capables de traiter et de générer plusieurs types de données — texte, images, parfois audio et vidéo — au sein d'un seul système. GPT-4V peut analyser des images et y répondre ; Gemini traite texte, images et audio ensemble. Cela brise les cloisons entre types de données : une usine peut montrer une image de caméra à un modèle multimodal et lui demander par texte quel défaut elle montre, en obtenant une réponse textuelle faisant référence au visuel.
Reconnaissance d'entités nommées (NER)
La reconnaissance d'entités nommées est une tâche de TALN qui identifie et classe automatiquement les entités clés dans un texte — noms de personnes, organisations, lieux, dates, montants — en catégories prédéfinies. C'est la première étape de nombreuses pipelines d'extraction d'information : un assistant juridique peut utiliser le NER pour extraire les noms de sociétés et dates de contrats de milliers de documents, et un système de santé peut extraire les noms de patients et mentions de médicaments des dossiers cliniques.
Traitement automatique du langage naturel (TALN)
Le traitement automatique du langage naturel est la branche de l'IA qui vise à permettre aux ordinateurs de comprendre, interpréter et générer le langage humain — texte et parole. Le TALN alimente les services de traduction, l'analyse de sentiment, les chatbots, le filtrage d'e-mails, les assistants vocaux et la résumé de documents. Les avancées récentes dans les modèles transformer ont considérablement amélioré les capacités du TALN, permettant des systèmes capables de conversations nuancées, de rédiger du code et de résumer des documents juridiques complexes dans plusieurs langues.
Recherche d'architecture neurale (NAS)
La recherche d'architecture neurale automatise la conception des architectures de réseaux de neurones en utilisant des algorithmes pour explorer un vaste espace d'architectures possibles et trouver les meilleures pour une tâche donnée. Au lieu qu'un chercheur décide du nombre de couches et filtres, NAS les découvre automatiquement. Elle a produit des architectures surpassant celles conçues par des humains, bien que le processus de recherche soit coûteux en calcul.
Réseau de neurones
Un réseau de neurones est un modèle computationnel inspiré du cerveau humain, composé de couches de nœuds interconnectés (neurones) qui traitent l'information en transmettant des signaux par des connexions pondérées. Chaque couche extrait des caractéristiques de plus en plus abstraites de l'entrée. Les réseaux de neurones sont le fondement du deep learning, alimentant la reconnaissance d'images, la synthèse vocale, la traduction et les jeux. L'idée clé est qu'avec assez de données et de couches, les réseaux peuvent apprendre pratiquement tout motif.