Aller au contenu
publicité
Accueil > Intelligence artificielle > Aide et conseils IA > Lexique de l’IA : 18 mots expliqués simplement
Aide & conseils · IA

Que veulent dire les mots de l'IA ?

Par La rédaction Bestforfait ·Mis à jour le ·4 min de lecture

Modèle, token, prompt, contexte, hallucination, fine-tuning : le vocabulaire de l’IA repris mot par mot, en langage clair, avec ce que chacun change concrètement pour vous.

La réponse en une phrase : vous n’avez besoin que de quatre mots pour vous en sortir — modèle, token, prompt et contexte. Les quatorze autres sont du confort.

Les 4 mots indispensables

Modèle

C’est le moteur. ChatGPT, Claude, Gemini et Mistral sont des noms commerciaux ; derrière, chacun fait tourner un ou plusieurs modèles, qui portent des noms de version. Changer de modèle, c’est changer de moteur : la vitesse, la qualité et le prix bougent en même temps.

Token

L’unité de facturation. Un token vaut à peu près trois quarts de mot en français. Retenez l’ordre de grandeur : 1 000 tokens font environ 750 mots, soit une page et demie. Les tarifs des API s’affichent presque toujours « par million de tokens », et on compte séparément ce que vous envoyez (l’entrée) et ce que l’IA répond (la sortie) — la sortie coûte généralement plus cher.

Prompt

Votre instruction. C’est le seul levier entièrement entre vos mains, et celui qui change le plus le résultat. Voir bien écrire un prompt.

Contexte

La mémoire de travail du modèle, exprimée en tokens. Un contexte de 200 000 tokens, c’est environ 150 000 mots — un gros roman. Au-delà, le modèle oublie le début de la conversation. C’est la différence la plus concrète entre deux abonnements : celui qui lit un contrat de 80 pages d’un seul tenant, et celui qui cale à la page 20.

Les mots qu’on croise ensuite

Hallucination

Une réponse fausse, mais formulée avec assurance. Ce n’est pas un bug : c’est le fonctionnement normal d’un modèle qui prédit le mot suivant. La parade est toujours la même — demander la source, et la vérifier.

Fenêtre de contexte

Synonyme de contexte. C’est le chiffre annoncé en « k » ou en « M » : 128k = 128 000 tokens.

Fine-tuning

Réentraîner un modèle existant sur vos propres données pour le spécialiser. Coûteux, et rarement nécessaire pour un particulier : un bon prompt ou un RAG suffisent presque toujours.

RAG

Donner au modèle vos documents au moment de la question, plutôt que de le réentraîner. C’est la méthode la plus simple pour qu’une IA réponde sur vos données. Voir le RAG expliqué.

Embedding

Transformer un texte en une liste de nombres, pour que la machine compare des sens plutôt que des mots. C’est ce qui permet à une recherche de trouver « voiture » quand vous tapez « automobile ». Voir les embeddings.

LoRA

Une façon économique de spécialiser un modèle : au lieu de tout réentraîner, on ajoute une petite couche. Très utilisé pour les modèles d’image. Voir les LoRA.

Modèle de raisonnement

Un modèle qui « réfléchit » avant de répondre, en produisant des étapes intermédiaires. Il s’en sort bien mieux sur les problèmes complexes, mais consomme beaucoup plus de tokens de sortie — donc coûte plus cher à l’usage.

Multimodal

Un modèle qui comprend autre chose que du texte : images, son, parfois vidéo. C’est ce qui permet de photographier un document et de poser une question dessus.

Agent

Une IA autorisée à enchaîner des actions toute seule — chercher sur le web, lire un fichier, exécuter du code — au lieu de se contenter de répondre.

Open weights

Un modèle dont les poids sont téléchargeables : vous pouvez le faire tourner sur votre machine, sans abonnement et sans envoyer vos données à personne. À ne pas confondre avec « open source », qui suppose aussi de connaître les données d’entraînement. Voir faire tourner une IA en local.

Quantification

Compresser un modèle pour qu’il tienne sur une machine ordinaire, au prix d’un peu de qualité. C’est ce qui rend l’IA locale possible sur un PC grand public.

Température

Un réglage entre 0 et 1 qui décide si le modèle reste prudent (proche de 0) ou devient inventif (proche de 1). Pour un texte factuel, on descend ; pour de la création, on monte.

Prompt système

Une consigne permanente, donnée en amont de la conversation, qui fixe le rôle et les règles. C’est ce que configurent les assistants personnalisés.

Quota

La limite d’usage d’une offre gratuite. Elle s’exprime en messages par jour, en tokens par mois, ou en accès au modèle le plus performant. C’est presque toujours la vraie différence entre le gratuit et le payant.

Et concrètement, ça sert à quoi ?

À comparer. Deux abonnements au même prix peuvent offrir un contexte de 32 000 tokens contre 200 000 : ce n’est pas le même outil. Notre comparateur d’abonnements IA affiche ces chiffres côte à côte, et le comparateur de coût par usage les traduit en euros selon ce que vous faites réellement.

Les termes essentiels

IA générative
Intelligence artificielle qui crée du contenu nouveau (texte, image, audio, vidéo) à partir d'une consigne : ChatGPT, Claude, Gemini, Midjourney…
LLM
« Large Language Model », grand modèle de langage : le moteur des assistants conversationnels, entraîné sur d'énormes corpus de texte.
Token
L'unité de texte facturée par les IA (un mot court ou un morceau de mot). Les tarifs API s'expriment en prix par million de tokens, en entrée et en sortie.
Prompt
La consigne donnée à l'IA (question, instruction, contexte, exemples). Sa qualité détermine celle de la réponse.
Fenêtre de contexte
La quantité maximale de texte (en tokens) que le modèle peut prendre en compte d'un coup : conversation, documents joints et réponse comprise.
Hallucination
Réponse inventée mais énoncée avec assurance. Se réduit avec un RAG, des sources citées et des instructions précises — jamais totalement.
Embedding
Transformation d'un texte en vecteur de nombres qui capture son sens ; la brique de la recherche sémantique et des RAG.
RAG
« Retrieval-Augmented Generation » : l'IA va d'abord chercher les passages pertinents dans vos documents, puis rédige à partir d'eux (technique publiée en 2020).
Fine-tuning
Réentraînement d'un modèle existant sur vos données pour le spécialiser. Coûteux ; souvent remplacé par un LoRA ou un RAG.
LoRA
« Low-Rank Adaptation » (2021) : spécialisation légère d'un modèle en n'entraînant qu'une petite fraction de ses paramètres. Standard pour personnaliser la génération d'images.
Paramètres
Les « réglages internes » appris par le modèle, comptés en milliards (7B = 7 milliards). Plus de paramètres = plus capable, mais plus gourmand.
Quantification
Compression d'un modèle (ex. format Q4) pour qu'il tienne dans moins de mémoire, avec une perte de qualité minime : c'est elle qui rend l'IA locale accessible.
VRAM
La mémoire de la carte graphique : le critère n°1 pour l'IA en local (8 Go = modèles 7-8B, 24 Go = 30B et plus).
Poids ouverts (open weights)
Modèles téléchargeables librement (Llama, Mistral, Gemma, Qwen, DeepSeek…) qu'on peut exécuter chez soi, par opposition aux modèles fermés accessibles uniquement en ligne.
Multimodal
Se dit d'un modèle qui comprend et produit plusieurs formats : texte, image, audio, vidéo.
Agent IA
IA qui enchaîne elle-même des actions (chercher, ouvrir des outils, exécuter des étapes) pour accomplir une tâche, au lieu de seulement répondre.
Inférence
La phase d'utilisation du modèle (générer une réponse), par opposition à son entraînement. C'est elle qui est facturée au token dans le cloud.

Avant de partir : des abonnements IA à moins de 10 €

Quatre offres tirées au hasard parmi celles que nous suivons, au prix mensuel annoncé par l’éditeur, au .

Comparer toutes les IA du marché

← Tous les guides IA