La bibliothèque 212AY
Glossaire
IA.
200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.
200 termes
Réseau de neurones convolutif (CNN)
Un réseau de neurones convolutif est un type de réseau spécialisé dans le traitement de données en grille comme les images, utilisant des filtres qui glissent sur l'entrée pour détecter des motifs locaux comme des bords, des textures et des formes. Les CNN ont révolutionné la reconnaissance d'images : ils alimentent la reconnaissance faciale sur les téléphones, le contrôle qualité en usine et l'analyse d'images médicales. Un hôpital marocain peut utiliser un CNN pour dépister la tuberculose sur des radiographies pulmonaires, avec une vitesse et une précision qui complètent les radiologues sans les remplacer.
Apprentissage par curriculum
L'apprentissage par curriculum est une stratégie où le modèle reçoit d'abord des exemples faciles, la difficulté augmentant progressivement. Comme les étudiants qui maîtrisent l'arithmétique avant le calcul, les modèles ainsi entraînés apprennent plus vite et généralisent mieux. Cette approche réduit le temps d'entraînement et améliore la performance finale.
Augmentation de données
L'augmentation de données consiste à élargir artificiellement un jeu de données d'entraînement en créant des copies modifiées de données existantes : rotation ou retournement d'images, reformulation de texte, ajout de bruit à de l'audio ou synthèse de nouveaux exemples. Cela aide les modèles à mieux généraliser et réduit le surapprentissage, surtout quand collecter de vraies données est coûteux. Un hôpital marocain disposant de peu de radiographies pour des maladies rares peut enrichir son jeu en appliquant des rotations et des variations de luminosité aux scans existants.
Nettoyage de données
Le nettoyage de données détecte et corrige les erreurs et incohérences dans un jeu de données avant l'analyse ou l'entraînement. Il gère les valeurs manquantes, supprime les doublons et corrige les formats. La mauvaise qualité des données est la première cause d'échec des projets IA. Les pipelines automatisés avec revue humaine sont l'approche standard.
Étiquetage de données
L'étiquetage de données attribue des balises significatives à des données brutes pour que les modèles supervisés puissent en apprendre. Une étiquette peut marquer une image comme contenant un chat ou identifier un cadre de délimitation. L'étiquetage est souvent l'étape la plus chronophage d'un projet IA, d'où l'utilisation de plateformes et du crowdsourcing.
Pipeline de données
Un pipeline de données est une série d'étapes automatisées qui collectent, transforment et livrent les données de la source à la destination. Les pipelines gèrent l'extraction, le nettoyage, l'ingénierie des caractéristiques et le chargement. Un pipeline bien construit garantit des données fraîches et cohérentes.
Jeu de données
Un jeu de données est une collection structurée de données utilisée pour entraîner, valider ou tester des modèles d'IA. La qualité et la diversité du jeu déterminent la performance réelle du modèle : des données biaisées produisent des modèles biaisés. Les jeux vont de quelques centaines de lignes pour un prototype à des milliards d'images pour des modèles de base. Les jeux ouverts populaires incluent ImageNet pour la vision, Common Crawl pour le langage, et les portails de données ouvertes gouvernementaux utilisés par les data scientists marocains.
Arbre de décision
Un arbre de décision est un modèle qui prédit en apprenant une série de règles si-alors à partir des données, en séparant à chaque étape la caractéristique qui distingue le mieux les classes. Il ressemble à un organigramme : on part de la racine, on répond à une question, on suit la branche, on recommence. Les arbres sont très interprétables — chaque chemin de décision est visualisable — ce qui les rend populaires dans les secteurs réglementés comme la banque. Une banque marocaine pourrait en utiliser un pour l'octroi de crédits selon le revenu, l'âge et l'emploi.
Deepfake
Un deepfake est un média synthétique généré par l'IA pour représenter quelqu'un disant ou faisant quelque chose qu'il n'a jamais fait. La technologie échange des visages et clone des voix. Les deepfakes posent des risques de manipulation politique et de fraude. La détection et le tatouage numérique sont des domaines de recherche actifs.