Aller au contenu
publicité
Accueil > Intelligence artificielle > IA en local

Quelle IA peut tourner sur mon PC ?

Réponse rapide. C'est la VRAM de votre carte graphique qui décide — ni votre mémoire vive, ni votre processeur. On peut avoir 128 Go de RAM et ne pas faire tourner un modèle qu'une carte de 16 Go avale sans effort. Donnez votre carte ci-dessous : vous saurez ce qui tourne chez vous, en quelle qualité, avec quel logiciel — et si vous avez le droit de vendre ce que vous produisez avec.

Mis à jour le

La mémoire de votre carte graphique décide de tout. Un modèle doit y tenir en entier pour répondre vite. Votre mémoire vive ne vient qu'en second, quand ça déborde — et votre processeur en dernier.

Tout effacer

Avec 8 Go, aucun des modèles dont nous connaissons la taille ne tient entièrement dans votre carte. Regardez la colonne verdict : plusieurs tournent quand même en débordant sur la mémoire vive, en plus lent.
Classés par le meilleur modèle qui tient chez vous, pas par le plus économe dans l'absolu — c'est toute la différence avec les classements qui conseillent un modèle minuscule à une grosse carte.
Modèle Taille Il faut Chez vous Pour quoi faire Usage commercial
Qwen3.6 27B Alibaba indice 38 27 Md 15,5 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. Multimodal avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Gemma 4 31B Google indice 30 31 Md 17,8 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. Multimodal avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
gpt-oss 120B OpenAI indice 24 120 Md 69 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. LLM Texte avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Mélange d'experts : il occupe la mémoire de ses 120 milliards, mais il calcule beaucoup plus vite que sa taille ne le laisse croire. Le nombre exact de paramètres actifs n'est pas repris ici tant qu'il n'est pas relevé chez l'éditeur.
Phi-4 Microsoft indice 5 14 Md 8,1 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. LLM Texte avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Petit modèle taillé pour le raisonnement et le code. C'est l'exemple type du modèle qu'on spécialise avec un RAG ou un LoRA plutôt que d'aller chercher plus gros.
Muse Glimmer Meta indice 0 30 Md 17,3 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. Multimodal avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Dense 30 milliards, Apache 2.0, agentique. ⚠ Ne tient PAS sur une carte de 16 Go : il faut 24 Go. C'est le cas d'école de cette page — Nicolas possède les 5080 et 5070 Ti, et ni l'une ni l'autre ne le fait tourner en mémoire vidéo.
Qwen3.8-27B Alibaba indice 0 27 Md 15,5 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. Multimodal avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Dense 27 milliards, licence Apache 2.0, multimodal (texte, image, vidéo), contexte natif 262 144 jetons.
Qwen3.8 2.4T A95B Alibaba 2400 Md dont 95 Md actifs 1380 Go en 4 bits Hors de portée Même en débordant sur la mémoire vive, il n'y a pas la place. Il faudrait une carte plus grande, ou un modèle plus petit. LLM Texte avec LM Studio ou Ollama Ouvert vérifiez la licence exacte du modèle avant de vendre
Le « A95B » du nom désigne les paramètres ACTIFS. Hors de portée d'une machine personnelle : il faut loger les 2 400 milliards en mémoire, même si seuls 95 travaillent à chaque jeton.
Un modèle trop gros pour votre carte peut quand même tourner. Il sera juste beaucoup plus lent. Ce qui ne tient pas dans la mémoire vidéo passe sur la mémoire vive, puis sur le disque : la réponse met des minutes au lieu de quelques secondes, mais elle arrive. Les autres sites affichent « compatible » ou « incompatible » ; la réalité est un dégradé. Essayez avant de renoncer — et si l'attente vous convient, elle vous convient.

Pas encore relevés — 28 modèles

Ces modèles sont bien au catalogue et tournent en local, mais nous n'avons pas encore relevé leur taille chez leur éditeur, ou mesuré ce qu'ils demandent réellement. Nous préférons l'écrire plutôt que de vous donner une estimation qui aurait l'air juste. Ils arriveront dans le tableau au fur et à mesure des essais — chaque ligne du tableau vient d'une source ouverte ou d'une mesure faite sur une vraie carte.

Avec quel logiciel ?

Un modèle est un fichier : il lui faut un logiciel pour tourner. Tous ceux-ci sont gratuits et s'installent en quelques minutes.

Notre guide : quel logiciel gratuit pour faire tourner une IA en local

Pourquoi nos chiffres ne sont pas ceux des autres

La plupart des sites qui répondent à cette question calculent un seuil à partir d'une fiche technique. Nous faisons les deux : le calcul de mémoire est expliqué ci-dessous et vous pouvez le refaire vous-même, et les vitesses affichées viennent d'essais réels sur de vraies cartes — pas d'une formule.

Le calcul, en clair. Un modèle occupe son nombre de paramètres multiplié par le poids de chaque paramètre : 2 octets en pleine précision, 1 octet en 8 bits, un demi-octet en 4 bits. Un modèle de 27 milliards en 4 bits demande donc environ 13,5 Go, plus une marge d'environ 15 % pour le contexte et le fonctionnement du logiciel. Quantifier, c'est réduire la précision de chaque paramètre pour tenir dans moins de mémoire : en 4 bits, la perte de qualité est faible et le gain de place énorme. C'est la première chose à essayer.

Et pour les modèles à experts (MoE), la mémoire suit la taille totale, pas les paramètres actifs : tous les experts doivent être chargés, même si quelques-uns seulement travaillent à chaque mot. C'est pourquoi un modèle annoncé « rapide » peut rester impossible à loger chez soi.

Questions fréquentes

Quelle mémoire vidéo faut-il pour faire tourner une IA en local ?
Il n'y a pas de minimum absolu : tout dépend de la taille du modèle. Avec 8 Go on fait tourner confortablement des modèles jusqu'à environ 13 milliards de paramètres en 4 bits. Avec 16 Go on monte vers 27 à 31 milliards. Au-delà de 24 Go, presque tout le catalogue grand public passe. Le formulaire en haut de cette page fait le calcul pour votre carte.
Est-ce que la mémoire vive peut remplacer la mémoire vidéo ?
Non, elle la complète. Quand un modèle dépasse la mémoire de la carte, le surplus bascule sur la mémoire vive : ça continue de fonctionner, mais beaucoup plus lentement, parce que les échanges entre la carte et la mémoire du PC sont bien plus lents que la mémoire de la carte elle-même. Avoir 128 Go de mémoire vive ne compense pas une carte de 8 Go.
Une IA en local est-elle vraiment gratuite et illimitée ?
Oui pour l'usage : aucun abonnement, aucun quota de messages, et vos données ne quittent pas votre ordinateur puisque tout est calculé chez vous. Le coût est ailleurs : la carte graphique, et l'électricité. Attention toutefois à la licence du modèle si vous comptez vendre ce que vous produisez — « ouvert » ne veut pas toujours dire « commercialement libre ».
Faut-il une carte NVIDIA, ou une carte AMD suffit-elle ?
Une carte AMD fait tourner une partie des modèles, et elle le fait honorablement sur le texte. Mais elle n'est pas optimisée comme une NVIDIA : les outils sortent d'abord pour les RTX, beaucoup de modèles n'existent que dans leur format, et il faut souvent bricoler pour démarrer. C'est exactement pour ça qu'une RTX coûte plus cher — vous ne payez pas que de la mémoire, vous payez le fait que tout marche du premier coup. Si vous achetez une carte pour faire de l'IA, et surtout pour générer des images ou des vidéos, prenez une RTX.
Un petit modèle peut-il faire aussi bien qu'un gros ?
Sur une tâche précise, oui. Un petit modèle branché sur vos propres documents (un RAG) ou spécialisé par un LoRA se comporte, dans son domaine, comme un modèle bien plus gros — et il tient sur une carte modeste. C'est la vraie manière de tirer parti d'une machine limitée.
Et sur un Mac ?
Sur les Mac à puce Apple (M1 à M4), il n'y a pas de mémoire vidéo séparée : le graphique partage la mémoire vive. Un Mac de 32 Go se comporte donc à peu près comme une carte de 22 Go — excellent pour le texte, il fait tourner des modèles qu'aucune carte grand public ne loge. En revanche, l'image, la vidéo, la 3D et la musique ne sont pas praticables sur Mac : ces outils sont écrits pour NVIDIA, et ComfyUI n'y est pas utilisable sérieusement. Pour créer des visuels chez vous, il faut une RTX. Choisissez « Mac Apple Silicon » dans le formulaire, le calcul et les avertissements en tiennent compte.
Vous savez ce qui tourne chez vous. Reste à voir ce que valent ces modèles, et ce que coûterait la même chose en ligne.