ACTUS TECH – Si la Nvidia GeForce RTX 4080 suffit amplement pour jouer, un moddeur s’est heurté à ses limites dans les tâches liées à l’IA.
Pour exécuter des modèles d’IA de meilleure qualité dans de bonnes conditions, le GPU doit disposer d’une énorme quantité de VRAM. Pour le propriétaire d’une RTX 4080, faire tourner les jeux les plus exigeants visuellement et graphiquement relève peut-être du jeu d’enfant, mais l’exécution de grands modèles de langage (LLM) est une tâche autrement plus ardue. Un moddeur souhaitant réunir ces deux usages dans un seul PC gaming a réussi à faire fonctionner une Nvidia Tesla V100 dans sa machine, non sans rencontrer plusieurs difficultés. Impossible de brancher la Tesla V100 sur une carte mère de bureau comme un simple périphérique plug-and-play : Tymscar a donc dû acheter un adaptateur SXM2–PCIe. Le GPU équipé de 16 Go de mémoire HBM2 et l’accessoire lui ont coûté 200 livres sterling. Avec ses 5 120 cœurs CUDA et son bus de 4 096 bits offrant 900 Go/s de bande passante, la Tesla V100 conserve encore une certaine puissance de calcul.
Se procurer l’adaptateur SXM2–PCIe n’était pas l’étape la plus difficile, mais l’opération n’avait rien de simple, surtout lorsqu’il a découvert que la Tesla V100 ne possédait ni connecteur PCIe standard, ni sorties d’affichage, ni prises d’alimentation PCIe. Comme le montre l’image ci-dessous, raccorder le GPU à un système de refroidissement à chambre à vapeur peut convenir à ceux que le bruit excessif ne dérange pas, mais à 82 dB, le vacarme devient pénible pour n’importe qui. Grâce à quelques petites modifications — une pile de 9 V et un cavalier PWM destiné à réduire le bruit du ventilateur — le refroidissement modifié de la V100 ne tournait plus qu’à 10 % de sa vitesse maximale d’origine.
Une fois ce problème résolu, le moddeur a trouvé le moyen d’intégrer 32 Go de VRAM exploitable à son système. Il a lancé Qwen3.6-27B-MTP, quantifié en Q5_K_M, qui occupe 19 Go. Avec une fenêtre de contexte de 128 000 tokens, il restait suffisamment de VRAM pour exécuter le LLM à 32 tokens par seconde. Le traitement des prompts oscillait entre 133 et 160 tokens par seconde, ce qui constitue une performance tout à fait honorable.
Le meilleur dans tout cela, c’est qu’il devient possible de faire tourner chez soi ses propres modèles d’IA de petite et moyenne taille pour moins de 300 dollars, gratuitement à l’usage et sans connexion Internet.







