Aller au contenu
publicité
Accueil > Intelligence artificielle

Quelle IA choisir : un abonnement en ligne, ou une IA installée chez vous ?

Réponse rapide. Il y a deux façons d'utiliser une IA. En ligne, par abonnement (ChatGPT, Claude, Gemini, Mistral…) : rien à installer, la puissance est chez l'éditeur, vous payez au mois ou à la consommation. En local, sur votre ordinateur : gratuit, illimité et hors ligne, mais c'est la VRAM de votre carte graphique qui décide de ce que vous pourrez faire tourner. Cette page vous envoie sur la bonne porte : ce que ça coûte, ce qui existe, et ce que votre machine peut encaisser.

Mis à jour le

Pour une IA en ligne, la seule question est le prix par rapport à ce que vous en faites vraiment : un abonnement à 20 € par mois est cher pour dix questions et donné pour trois cents. Pour une IA chez vous, la question est matérielle : la VRAM d'abord, la mémoire vive ensuite, le processeur en dernier. Choisissez votre porte, l'explication détaillée suit juste après.

Vous hésitez encore ? Commencez par les différentes sortes d'IA ou par le lexique en 18 mots — cinq minutes, et les quatre portes ci-dessus deviennent évidentes.

Une IA en ligne : vous louez la puissance

Vous ouvrez un site ou une application, vous écrivez, la réponse arrive. Le calcul se fait chez l'éditeur, sur des machines que personne ne peut s'offrir chez soi : c'est pourquoi les modèles en ligne restent les plus puissants du marché. En échange, vous payez — soit un abonnement mensuel (le forfait : simple, mais vous payez même les mois où vous ne l'utilisez pas), soit à la consommation, au million de mots traités (l'API : vous ne payez que ce que vous consommez, mais la facture n'est pas connue à l'avance). Et vos échanges partent chez l'éditeur : c'est le vrai prix, celui qui ne s'affiche pas.

C'est là que nos deux outils servent : l'un chiffre votre dépense à partir de votre volume réel, l'autre met tous les modèles côte à côte.

Une IA chez vous : la VRAM décide de tout

Une IA installée sur votre ordinateur ne coûte rien, ne compte pas vos questions et fonctionne sans Internet. Mais elle doit tenir dans votre machine, et l'ordre des trois pièces qui comptent n'est pas celui qu'on croit :

La VRAM de la carte graphique La mémoire de la carte, pas celle du PC. C'est elle qui accueille le modèle : 8, 12, 16, 24 ou 32 Go changent complètement ce que vous pouvez lancer. On peut avoir 128 Go de mémoire vive et ne pas faire tourner ce qu'une carte de 16 Go avale sans effort.
La mémoire vive (RAM) Le filet de sécurité. Quand le modèle dépasse la VRAM, ce qui dépasse bascule dans la RAM du PC : ça continue de marcher, mais c'est la RAM qui devient le goulot. Elle compte, elle ne remplace pas la VRAM.
Le processeur Le dernier des trois — sauf si vous n'avez pas de carte graphique dédiée. Là, c'est lui qui fait tout le travail : ça fonctionne, sur de petits modèles, avec de la patience.
Et voici ce que presque personne ne dit : un modèle trop gros pour votre carte tourne quand même. Il sera simplement beaucoup plus lent. Ce qui ne tient pas dans la VRAM passe sur la RAM, puis sur le disque : la réponse met des minutes au lieu de quelques secondes, mais elle arrive. Les autres sites affichent « compatible » ou « incompatible » ; la réalité est un dégradé. Ne renoncez pas avant d'avoir essayé — et si l'attente vous va, elle vous va.

Gros modèle ou petit modèle ? Ça dépend de ce que vous en faites

Un petit modèle léger discute très bien, résume, reformule, répond aux questions courantes — et il répond vite. Il perd pied sur les tâches complexes : raisonnement en plusieurs étapes, long document à tenir en tête, code délicat. Un gros modèle tient ces tâches, mais il demande plus de mémoire et vous fait attendre.

Il n'y a pas de bon choix dans l'absolu, il y a le vôtre : essayez, et regardez le temps d'attente que vous acceptez. C'est le seul arbitrage qui compte, et il est différent pour chacun.

Un petit modèle spécialisé bat un gros modèle généraliste

C'est le secret le mieux gardé de l'IA locale. Sur une seule tâche, une petite IA que vous avez spécialisée fait aussi bien — souvent mieux — qu'un modèle géant, chez vous et gratuitement. Trois manières de le faire, de la plus simple à la plus poussée :

Le RAG — vous branchez l'IA sur vos documents. Elle répond à partir de vos fichiers au lieu de sa mémoire générale : elle cesse d'inventer, et elle connaît votre métier. Comment ça marche, expliqué simplement.
Le LoRA — un petit fichier greffé sur le modèle qui lui apprend un style, un domaine ou un vocabulaire, sans le réentraîner et sans matériel de laboratoire. Ce qu'est un LoRA.
Les deux ensemble, avec une recherche mieux ciblée dans vos documents : c'est ce qu'on appelle un RAG avancé. Sur son domaine, votre petite IA locale se comporte comme un gros modèle.

Chaque modèle a son terrain

Un modèle n'est pas « bon » ou « mauvais » : il est bon à quelque chose. Les Phi de Microsoft sont taillés pour le raisonnement et le code alors qu'ils sont petits ; les modèles FLUX ne font que de l'image, et ils la font très bien ; d'autres sont pensés pour la vidéo, la voix ou les agents qui enchaînent des tâches toutes seules. Regardez d'abord ce que vous voulez produire, le modèle vient après.

Nos fiches indiquent aussi une chose que personne d'autre ne donne : la licence commerciale — le droit, ou non, de vendre ce que vous produisez avec. Si vous créez pour gagner votre vie, c'est la première colonne à lire.

Vous savez maintenant ce que vous cherchez. Reste à trancher : ce que ça coûte, ou ce qui existe.