La bibliothèque 212AY

Glossaire
IA.

200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.

200 termes

Traitement du langage

Recherche sémantique

La recherche sémantique récupère l'information en se basant sur le sens plutôt que sur la correspondance exacte de mots-clés. Au lieu de chercher la phrase exacte, elle comprend que « hôtel abordable près de la médina » et « riad économique dans la vieille ville » demandent la même chose. Elle utilise des embeddings pour convertir les requêtes et les documents en vecteurs, puis trouve les vecteurs les plus proches. La recherche sémantique est le fondement des systèmes RAG modernes et des moteurs de recherche de produits.

Traitement du langage

Analyse de sentiment

L'analyse de sentiment détermine automatiquement la tonalité émotionnelle d'un texte — positive, négative ou neutre — à grande échelle. Les entreprises l'utilisent pour surveiller la réputation de marque, analyser les avis clients, suivre les réactions sur les réseaux sociaux et prioriser les tickets de support. Une compagnie aérienne marocaine pourrait analyser le sentiment de milliers de mentions Twitter pour détecter instantanément une hausse des plaintes après un vol retardé.

Fondamentaux

Softmax

Softmax est une fonction mathématique qui convertit un vecteur de scores bruts (logits) en une distribution de probabilités, où chaque valeur est entre 0 et 1 et toutes somment à 1. C'est la couche finale standard des réseaux de neurones de classification, transformant les sorties brutes en probabilités interprétables de classes.

Traitement du langage

Synthèse vocale

La synthèse vocale (text-to-speech ou TTS) est la tâche d'IA générant un audio parlé naturel à partir de texte. Les systèmes TTS modernes utilisent des modèles de deep learning pour produire une voix presque indistinguable de l'humain. Applications : assistants virtuels, narration d'audiolivres, outils d'accessibilité, systèmes téléphoniques et localisation de contenu. ElevenLabs, TTS d'OpenAI et Bark sont des exemples notables.

Fondamentaux

Apprentissage supervisé

L'apprentissage supervisé est la branche du machine learning où un modèle apprend à partir d'exemples étiquetés — paires entrée-sortie avec la bonne réponse fournie — pour faire des prédictions sur de nouvelles données. Les deux tâches principales sont la classification (prédire des catégories) et la régression (prédire des valeurs continues). C'est le paradigme ML le plus utilisé : scoring de crédit, prévision de la demande, diagnostic médical en dépendent.

Data Science

Données synthétiques

Les données synthétiques sont des données générées artificiellement qui imitent les propriétés statistiques de données réelles sans contenir d'informations personnelles ou sensibles. Elles servent à enrichir de petits jeux de données, protéger la vie privée, tester des systèmes et entraîner des modèles quand les données réelles sont rares ou réglementées. Un hôpital marocain disposant de peu de radiographies pédiatriques pourrait générer des images synthétiques pour entraîner un modèle diagnostique sans risquer la vie privée des patients.

Data Science

t-SNE

t-SNE est une technique de réduction de dimensionnalité conçue pour visualiser des données à haute dimensionnalité en 2D ou 3D. Elle mappe les points similaires près les uns des autres et les dissemblables loin, révélant des structures de clusters invisibles dans l'espace haute dimension. Largement utilisé pour visualiser des embeddings et explorer des données. Cependant, il est lent sur de grands jeux et principalement destiné à la visualisation.

Data Science

Données tabulaires

Les données tabulaires sont organisées en lignes et colonnes, comme un tableur ou une base de données, où chaque ligne est une observation et chaque colonne une caractéristique. C'est le format de données le plus courant en entreprise : ventes, clients, transactions financières et RH produisent des données tabulaires. Les algorithmes ML traditionnels (forêts aléatoires, XGBoost) surpassent souvent le deep learning sur les données tabulaires.

LLM & Modèles

Température

La température est un paramètre contrôlant l'aléatoire des sorties d'un modèle de langage. À température 0, le modèle choisit toujours le token le plus probable (déterministe, répétitif). À mesure que la température augmente, le modèle accorde plus de probabilité aux tokens moins probables, produisant une sortie plus diverse mais aussi plus imprévisible. 0,7 est courant pour les chatbots ; 0,2 pour les questions factuelles ; 1,0+ pour l'écriture créative.