La bibliothèque 212AY

Glossaire
IA.

200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.

200 termes

Deep Learning

Deep Learning (apprentissage profond)

Le deep learning est une branche du machine learning qui utilise des réseaux de neurones à nombreuses couches pour apprendre automatiquement des représentations hiérarchiques des données. Au lieu de concevoir des caractéristiques à la main, les modèles découvrent des motifs directement à partir de données brutes : pixels pour les images, mots pour le texte, formes d'onde pour l'audio. Il alimente des avancées en reconnaissance d'images, synthèse vocale, traduction et conduite autonome. La contrepartie : les modèles de deep learning nécessitent de gros jeux de données et une puissance de calcul importante.

Deep Learning

Modèle de diffusion

Un modèle de diffusion est une IA générative qui crée des données en ajoutant du bruit aux exemples d'entraînement jusqu'au statique pur, puis en apprenant à inverser le processus. Cela produit des images d'un réalisme stupéfiant, à la base de Stable Diffusion, DALL-E et Midjourney. Ils ont largement remplacé les GANs grâce à leur stabilité.

Data Science

Réduction de dimensionnalité

La réduction de dimensionnalité compresse des données à haute dimensionnalité en moins de caractéristiques tout en préservant l'information la plus importante, facilitant la visualisation, le traitement et la modélisation. L'ACP (analyse en composantes principales) est la méthode linéaire classique ; t-SNE et UMAP sont des alternatives non linéaires populaires pour la visualisation. Un data scientist chez un opérateur télécom marocain pourrait réduire des centaines de variables de comportement client en quelques composantes avant de faire du clustering ou construire un modèle de churn.

Infrastructure IA

Entraînement distribué

L'entraînement distribué répartit le calcul sur plusieurs GPU ou machines, réduisant considérablement le temps d'entraînement. Des centaines de GPU travaillent en parallèle. Des frameworks comme DistributedDataParallel et DeepSpeed gèrent la coordination. Entraîner des modèles de la classe de GPT-4 serait impossible sans ces techniques.

Deep Learning

Dropout (abandon aléatoire)

Le dropout est une technique de régularisation pour les réseaux de neurones où des neurones sélectionnés aléatoirement sont temporairement ignorés à chaque étape d'entraînement, forçant le réseau à apprendre des représentations redondantes plutôt que de dépendre d'un seul neurone. C'est comme une équipe où des membres aléatoires s'assoient à chaque entraînement, rendant les joueurs restants plus polyvalents. Le dropout réduit significativement le surapprentissage et est l'un des astuces les plus utilisées en deep learning, appliqué en vision, langage et recommandation.

Infrastructure IA

Edge IA (IA en périphérie)

L'edge IA désigne l'exécution de modèles d'IA directement sur des appareils locaux — smartphones, capteurs, caméras ou passerelles IoT — au lieu d'envoyer les données vers un serveur cloud distant. Cela réduit la latence, économise la bande passante et préserve la vie privée car les données ne quittent jamais l'appareil. Une usine marocaine peut faire tourner des modèles de détection de défauts sur les caméras de la chaîne de production, obtenant des résultats instantanés sans connexion internet. Les modèles quantifiés et distillés rendent le déploiement en edge réalisable.

Fondamentaux

Modèle d'embeddings

Un modèle d'embeddings convertit des entrées en vecteurs numériques denses où les éléments sémantiquement similaires se regroupent. Les modèles populaires incluent text-embedding-ada-002, Sentence-BERT et CLIP. Ils alimentent la recherche sémantique, les recommandations et les pipelines RAG.

Fondamentaux

Embeddings (représentations vectorielles)

Les embeddings sont des représentations numériques denses de mots, phrases, images ou autres points de données, où les éléments similaires sont proches dans un espace vectoriel à haute dimension. Ils captent le sens sémantique : les embeddings de « roi » et « reine » sont plus proches entre eux que de « voiture ». Les embeddings alimentent la recherche sémantique, les systèmes de recommandation et les pipelines RAG. Un site e-commerce marocain utilise des embeddings textuels pour associer les requêtes clients aux descriptions de produits les plus pertinentes.

Fondamentaux

Apprentissage par ensemble

L'apprentissage par ensemble combine plusieurs modèles pour produire des prédictions plus précises et robustes qu'un seul modèle. Les forêts aléatoires agrègent des centaines d'arbres de décision ; les machines à gradient boosting corrigent séquentiellement les erreurs des modèles précédents. Le principe de la sagesse des foules : chaque modèle a des faiblesses différentes, donc la moyenne ou le vote annule les erreurs individuelles. Les ensembles dominent les compétitions Kaggle et sont largement utilisés en scoring de crédit, détection de fraude et prévision de la demande.