La bibliothèque 212AY
Glossaire
IA.
200+ termes d'intelligence artificielle expliqués simplement — du machine learning aux LLM, en passant par les agents IA, le RAG et le prompt engineering. Chaque définition avec un exemple concret, en français, anglais et arabe.
200 termes
Génération de texte
La génération de texte est la tâche consistant à produire automatiquement du texte semblable à l'humain à partir d'un prompt ou d'un contexte. La génération moderne utilise de grands modèles de langage qui prédisent le token le plus probable de manière itérative. Les applications incluent la rédaction d'e-mails, la création de contenu, l'écriture de code, la résumé, la traduction et les réponses de chatbots. La qualité dépend fortement du design du prompt, du choix du modèle et des paramètres comme la température.
Synthèse vocale (TTS)
La synthèse vocale convertit du texte écrit en sortie audio parlée. Les systèmes modernes produisent une voix naturelle et expressive avec prosodie, émotion et rythme appropriés. Ils alimentent Siri et Alexa, des outils d'accessibilité, des systèmes téléphoniques et la narration d'audiolivres. Les modèles neuronaux comme ceux d'ElevenLabs et OpenAI peuvent cloner des voix spécifiques à partir de courts échantillons audio.
Prévision de séries temporelles
La prévision de séries temporelles prédit des valeurs futures à partir de données séquentielles historiques — prix d'actions, trafic web, consommation d'énergie, météo. Les approches IA incluent ARIMA, les forêts aléatoires sur des caractéristiques conçues et le deep learning (LSTMs, transformers). Un détaillant marocain pourrait prévoir la demande pour optimiser les stocks, réduisant ruptures et surstock.
Token
Un token est la plus petite unité de texte qu'un modèle de langage traite. Pour l'anglais, un token correspond environ à 4 caractères ou ¾ de mot ; pour l'arabe et le français, les frontières varient. Les modèles utilisent le nombre de tokens pour gérer leur fenêtre de contexte et calculer les coûts. Comprendre les tokens est important pour le prompt engineering : les prompts longs consomment plus de tokens, et chaque modèle a une limite maximale par requête.
Tokenisation
La tokenisation est le processus de découpage du texte brut en tokens — les unités qu'un modèle de langage lit réellement. Différentes tokenisations gèrent des mots, des sous-mots ou des caractères selon le modèle. La tokenisation au niveau mot sépare par des espaces ; les tokeniseurs sous-mot comme BPE fusionnent les séquences de caractères courantes pour gérer les mots rares. Une tokenisation correcte est essentielle pour les modèles multilingues qui doivent gérer l'arabe, le français et l'anglais.
Utilisation d'outils
L'utilisation d'outils est la capacité d'un agent IA à invoquer des outils logiciels externes — navigateurs, API, bases de données, calculateurs, systèmes de fichiers — pour accomplir des tâches au-delà du texte. Quand un modèle appelle une API de recherche, écrit dans une base de données ou envoie un e-mail, il utilise des outils. L'utilisation d'outils transforme un modèle de langage en participant actif des workflows métier.
Données d'entraînement
Les données d'entraînement sont le jeu de données utilisé pour enseigner un modèle de machine learning par l'exemple. La qualité, la quantité et la représentativité des données déterminent directement la performance du modèle. Les données biaisées produisent des modèles biaisés. Elles sont généralement divisées en ensembles d'entraînement, validation et test.
Apprentissage par transfert
L'apprentissage par transfert prend un modèle entraîné sur une tâche et le réutilise pour une tâche différente mais liée, économisant d'énormes quantités de données et de calcul. Un modèle pré-entraîné sur des millions d'images générales peut être affiné avec quelques centaines de scans médicaux pour détecter des maladies. C'est pourquoi le développement IA moderne commence par des modèles de base pré-entraînés plutôt que par un entraînement from scratch, réduisant considérablement la barrière à l'entrée.
Transformer (architecture)
Le transformer est l'architecture de réseau de neurones qui a révolutionné le TALN et sous-tend tous les grands modèles de langage modernes. Son innovation clé est le mécanisme d'auto-attention, qui traite tous les tokens en parallèle plutôt que séquentiellement, permettant des accélérations massives et une bien meilleure gestion du contexte à longue portée. GPT, BERT, Claude, Gemini — tous basés sur le transformer. Les transformers alimentent aussi des modèles de vision, de parole et de recherche sur les protéines.