Actualité · Outils IA

NVIDIA PAIR : le routeur qui transforme tes PC en cluster IA local

12 septembre 2026 · 5 min de lecture

Illustration aquarelle d'un petit robot astronaute violet au cerveau lumineux, tenant un signal de routage, entouré de trois ordinateurs reliés par des fils menthe dans un salon transformé en cluster IA local, avec une silhouette de maison et une manette de jeu à côté d'un PC gaming

NVIDIA a sorti PAIR (Personal AI Router) le 11 septembre 2026. C'est un logiciel gratuit et open source qui distribue les requetes d'IA entre les ordinateurs de ta maison. Tu l'installs sur chaque PC, il decouvre les autres sur ton reseau local, et il route chaque appel de modele vers une machine disponible. Ton laptop, ta tour de gaming et ton Mac peuvent bosser ensemble sur des taches d'inference, sans que tu reconfigures tes agents.

C'est interessant parce que ca rend tangible une idee qui revient beaucoup dans l'IA en 2026 : faire tourner des modeles chez soi, sur son propre materiel, sans envoyer ses donnees vers un serveur distant. PAIR ne resout pas tout, mais il rend la chose plus pratique.

Le probleme que PAIR regle

Quand tu fais tourner des agents IA en local, tu utilises en general un seul PC avec un seul GPU. Ton agent envoie une requete, le GPU la traite, il renvoie la reponse. Tant que tu fais une chose a la fois, ca va.

Le probleme arrive avec les workflows multi-agents. Un agent principal decompose une tache, delegue des sous-taches a plusieurs subagents, et chaque subagent envoie sa propre requete au modele. Si tu as 5 subagents qui tournent en parallele, ton GPU recoit 5 appels simultanes. Il les met en file d'attente. Le premier tourne, les autres attendent. Ton PC est sature, mais le Mac sur le bureau a cote ne fait rien.

PAIR regle ca en elargissant le pool de calcul. Au lieu d'envoyer toutes les requetes vers un seul GPU, il les distribue entre les machines disponibles sur ton reseau local. Chaque requete reste sur un seul noeud de bout en bout (PAIR ne fusionne pas plusieurs GPU en un seul), mais plusieurs requetes tournent en parallele sur des machines differentes.

Comment ca marche en pratique

Tu installes PAIR sur chaque machine compatible. Il decouvre les autres systemes automatiquement via mDNS, le meme protocole que ton imprimante utilise pour se faire trouver sur le reseau. Tu valides le pairing avec un code a 6 chiffres, et la communication entre les noeuds est chiffree en mTLS.

Cote moteur, PAIR fonctionne avec Ollama et LM Studio, les deux services d'inference locale les plus populaires. Pas besoin de changer ton code : PAIR se comporte comme un proxy. Ton agent pense qu'il parle a Ollama sur localhost, et PAIR redirige la requete vers une autre machine si la tienne est occupee.

Pour chaque requete, PAIR verifie trois choses : est-ce que le noeud est online et pret, est-ce que le moteur d'inference est actif, et est-ce que le modele demande est present sur cette machine. Si oui, il envoie la requete. Si non, il cherche un autre noeud.

Les machines peuvent rejoindre le cluster quand elles sont disponibles et le quitter quand tu en as besoin. Tu peux lancer un jeu sur ton PC de gaming, et PAIR arrete de lui envoyer des requetes. Cote compatibilite : GPU NVIDIA GeForce RTX 20 series et plus recent, RTX Pro workstation, DGX Spark, et Apple Silicon M4 et plus recent. Windows 11, Linux, macOS, en x64 et arm64. Tu peux melanger les OS.

La demo de NVIDIA

NVIDIA a publie une demo avec Hermes Desktop, un agent qui decompose une tache en cinq analyses independantes. La tache : analyser une boite de reception et produire un plan de semaine. Hermes cree cinq specialistes, chacun traite une partie des emails, puis Hermes consolide les resultats.

Sur un seul RTX Spark laptop avec Qwen 3.6 35B, la tache prend 18 minutes en moyenne. Avec un cluster de trois machines (RTX Spark laptop, DGX Spark, et un PC avec RTX 5090), le meme travail prend 8 minutes et 48 secondes. Soit a peu pres deux fois plus rapide.

NVIDIA precise que ce n'est pas un benchmark officiel. Les resultats dependent du workload, du modele, du reseau, et de la disponibilite des noeuds. Mais l'idee est la : si ton workflow a assez de taches independantes, distribuer l'inference sur plusieurs machines reduit le temps total.

Ce que PAIR ne fait pas

NVIDIA est assez clair la dessus, et c'est important de le retenir parce que les reseaux sociaux ont deja commence a inventer.

PAIR ne fusionne pas plusieurs GPU en un seul accelerateur. Tu ne peux pas prendre deux RTX 3060 et faire tourner un modele qui demande 24 Go de VRAM. Chaque requete tourne sur un seul noeud, avec un seul GPU, de bout en bout.

PAIR ne te permet pas de partager ta capacite de calcul avec des tiers sur internet. C'est local, sur ton reseau domestique. Pas de cloud, pas de location de GPU.

PAIR ne remplace pas un moteur d'inference. Il route des requetes vers Ollama ou LM Studio, qui font le vrai travail. Si Ollama ne supporte pas un modele, PAIR ne le rendra pas supporte.

Si tu veux vraiment fusionner des GPU pour faire tourner un modele trop gros, il existe d'autres projets : Petals (qui partage le calcul de gros modeles entre plusieurs machines sur internet) ou Mesh LLM (qui peut splitter un modele sur plusieurs machines avec Skippy). PAIR ne fait rien de tout ca.

Un exemple chez Maisons&Mobilia

Antoine, lead developer chez Maisons&Mobilia (M&M, enseigne de meubles fictive), fait tourner des agents IA en local pour analyser les avis clients. Son workflow : un agent principal lit les avis, delegue l'analyse sentiment a un subagent, l'extraction de themes a un autre, et la detection de problemes de livraison a un troisieme. Trois subagents, trois requetes en parallele.

Avant PAIR, tout tournait sur le PC d'Antoine, avec une RTX 4070. Les trois subagents se partageaient un GPU, les requetes s'empilaient, et l'analyse complete prenait 12 minutes pour 500 avis.

Avec PAIR, Antoine installe le logiciel sur son PC et sur deux autres machines du bureau : un Mac M4 Pro et un vieux PC avec une RTX 3070. Les trois subagents tournent en parallele, un sur chaque machine. L'analyse complete prend 5 minutes. Antoine n'a rien change a son code : son agent parle toujours a Ollama sur localhost, et PAIR fait le routage.

La limite : Antoine doit installer le meme modele (Qwen 3.6 35B) sur les trois machines. Le modele fait 20 Go, donc il a besoin de 60 Go de stockage au total. Et si le Mac M4 Pro est en veille quand la tache tourne, PAIR n'envoie rien la-bas et le travail prend plus de temps. Ce n'est pas un cluster de datacenter, c'est un cluster de maison. Les machines viennent et partent.

Ce que ca change si tu apprends l'IA

  1. L'inference locale n'est plus un seul GPU. Si tu fais tourner des modeles chez toi (avec Ollama, LM Studio), tu n'as plus besoin d'un seul gros GPU. Tu peux accumuler plusieurs machines modestes et les faire bosser ensemble. C'est exactement la logique qui a pousse l'open-weight : des modeles comme GLM-5.3-Flash ou Qwen 3.7 tournent sur du materiel grand public, et PAIR rend ce materiel plus utile.

  2. L'infrastructure compte autant que le modele. On en a parle dans l'article sur l'Agents API d'OpenAI : le harness fait la difference entre un agent qui reste coherent sur 88 heures et un qui s'effondre apres 20 etapes. PAIR resout un probleme different mais lie : la contention de GPU. Quand tu as compris que le modele est le moteur et que l'infrastructure est la voiture, PAIR ajoute une route supplementaire.

  3. C'est un pas de plus vers l'autonomie. Faire tourner des agents en local, sur ton propre reseau, sans envoyer tes donnees vers un serveur distant, c'est un argument qui compte pour la confidentialite. C'est aussi un argument qui se heurte a la realite : la plupart des gens n'ont pas 3 PC avec des GPU compatibles chez eux. PAIR est un outil pour les prosommateurs d'IA, pas pour le grand public. Mais il montre la direction.

La competence pratique : savoir que l'inference locale peut se distribuer, et comprendre la difference entre un seul GPU sature et plusieurs GPU qui partagent la charge. Si tu construis des workflows multi-agents en local, c'est un bottleneck que tu vas rencontrer. PAIR est une reponse, pas la seule.

Aller plus loin

Pour comprendre comment un agent IA decompose une tache et delegue a des subagents, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous a mettre en place quand un agent accede a tes donnees, le guide sur les garde-fous des agents IA detaille le moindre privilege et le human in the loop. Pour comprendre le contexte de l'inference locale et des modeles open-weight, notre article sur GLM-5.3-Flash couvre le modele qui a demontre que l'open-source rattrape le frontier a un cout 10x inferieur. Et pour t'entrainer a ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les modeles, les agents et le deploiement, en francais, sans coder.

Sources

Questions fréquentes

C'est quoi NVIDIA PAIR ?
NVIDIA PAIR (Personal AI Router) est un logiciel gratuit et open source sorti en beta le 11 septembre 2026. Il distribue les requetes d'inference IA entre les ordinateurs de ton reseau local. Tu l'installs sur chaque machine, il decouvre les autres automatiquement, et il route chaque requete vers un PC disponible. Compatible avec Ollama et LM Studio, sur Windows, Linux et macOS.
NVIDIA PAIR est-il gratuit ?
Oui. PAIR est telechargeable gratuitement sur GitHub. C'est un logiciel open source. Tu paies l'electricite et le materiel (tes PC existants), mais l'outil lui-meme ne coute rien.
Est-ce que PAIR fusionne plusieurs GPU en un seul ?
Non. NVIDIA le dit explicitement : PAIR ne fusionne pas les GPU ni ne regroupe la VRAM. Il distribue des requetes independantes entre plusieurs machines. Chaque requete tourne sur un seul noeud, de bout en bout. Si tu veux faire tourner un modele trop gros pour un seul GPU, regarde plutot Petals ou Mesh LLM.
Quels PC sont compatibles avec PAIR ?
PAIR supporte les GPU NVIDIA GeForce RTX 20 series et plus recent, les RTX Pro workstation, les DGX Spark, et les Mac avec Apple Silicon M4 ou plus recent. Il tourne sur Windows 11, Linux et macOS, en x64 et arm64. Tu peux melanger des OS differents dans le meme cluster.
Faut-il etre developpeur pour utiliser PAIR ?
Pas forcement, mais il faut etre a l'aise avec l'installation d'outils en ligne de commande et la configuration d'Ollama ou LM Studio. NVIDIA propose une interface graphique et une documentation Getting Started sur GitHub. Pour un debutant complet, ca reste un outil technique, pas une app grand public.

Termes du glossaire