La bibliothèque 212AY
Glossaire
IA.
200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.
200 termes
Sous-ajustement
Le sous-ajustement survient quand un modèle est trop simple pour capturer les motifs sous-jacents des données, performer mal sur les données d'entraînement et de test. Contrairement au surapprentissage, le sous-ajustement n'apprend pas du tout. Causes : modèle trop simple, entraînement insuffisant ou caractéristiques inadéquates. Remèdes : modèle plus complexe, entraînement plus long, ajout de caractéristiques ou réduction de la régularisation.
Apprentissage non supervisé
L'apprentissage non supervisé est une branche du machine learning où le modèle trouve des motifs et une structure dans des données sans exemples étiquetés ni guidance humaine. Les tâches les plus courantes sont le clustering (regrouper des éléments similaires) et la réduction de dimensionnalité (compresser des caractéristiques). Il est utile quand les étiquettes sont coûteuses ou impossibles à obtenir : un détaillant découvre des segments naturels de clients, un chercheur identifie des groupes de gènes, et un système de sécurité détecte un comportement réseau inhabituel.
Base de données vectorielle
Une base de données vectorielle est un stockage spécialisé optimisé pour indexer et récupérer efficacement des vecteurs à haute dimensionnalité (embeddings). Contrairement aux bases de données classiques qui recherchent des valeurs exactes, les bases vectorielles trouvent les voisins les plus proches dans l'espace d'embedding, permettant la recherche sémantique, la correspondance de similarité et les systèmes RAG. Les options populaires incluent Pinecone, Weaviate, Qdrant et Milvus. Elles sont la colonne vertébrale des applications IA qui cherchent par sens plutôt que par mots-clés.
Recherche vectorielle
La recherche vectorielle est une technique de récupération d'éléments sémantiquement similaires en comparant leurs embeddings vectoriels plutôt que les correspondances exactes de mots-clés. Elle alimente les systèmes de recommandation et les moteurs de recherche sémantique.
Vibe coding
Le vibe coding est une pratique émergente où les développeurs décrivent ce qu'ils veulent en langage naturel et laissent des agents de code IA générer l'implémentation, en se concentrant sur l'intention plutôt que la syntaxe. Le développeur révise, guide et corrige la sortie. Des outils comme Replit Agent, Cursor et GitHub Copilot enable ce workflow. Il accélère considérablement le prototypage et permet aux non-développeurs de construire des outils fonctionnels, bien que le code de production nécessite encore une revue experte.
Modèle vision-langage (VLM)
Un modèle vision-langage est un système IA multimodal qui traite et raisonne sur les images et le texte simultanément, comprenant la relation entre contenu visuel et textuel. Exemples : GPT-4V, Gemini, LLaVA, Claude 3 Vision. Les VLM répondent à des questions sur des images, génèrent des descriptions textuelles de scènes visuelles et suivent des instructions multimodales complexes. Ils transforment l'interaction des entreprises avec les données visuelles.
Weaviate
Weaviate est une base de données vectorielle open source conçue pour les applications natives d'IA. Elle stocke et indexe des embeddings vectoriels aux côtés de leurs données originales, permettant la recherche sémantique, les recommandations et le RAG. Weaviate supporte la recherche hybride (vectorielle et par mots-clés), la vectorisation automatique via des modules ML intégrés, et s'horizontalise. Une startup marocaine pourrait l'utiliser pour une recherche de produits par sens.
Automatisation de workflow
L'automatisation de workflow connecte plusieurs outils logiciels et composants IA en une séquence exécutant des processus métier sans intervention manuelle. L'automatisation traditionnelle suit des règles fixes (Zapier, Make) ; l'automatisation enrichie par l'IA ajoute la compréhension du langage et la prise de décision. Une entreprise logistique marocaine pourrait automatiser le traitement des commandes : recevoir par e-mail, extraire les détails par IA, vérifier le stock et déclencher l'expédition.
XGBoost
XGBoost est un algorithme de machine learning hautement efficace basé sur le gradient boosting d'arbres de décision. Il construit les arbres séquentiellement, chaque nouvel arbre corrigeant les erreurs des précédents. XGBoost remporte constamment des compétitions Kaggle et est l'algorithme de référence pour les données tabulaires : détection de fraude, prédiction de churn, scoring de crédit. Il est rapide, gère nativement les valeurs manquantes et inclut une régularisation intégrée.