Actualite · Agents IA
Perplexity Portable Computer : un agent IA qui tourne sur ta machine, pas dans le cloud
26 août 2026 · 5 min de lecture

Tu demandes a un agent IA d'analyser un dossier de 50 fiches fiscales. L'agent ouvre chaque document, extrait les chiffres, verifie les erreurs, croise les donnees et produit un rapport. En cloud, chaque token consomme par l'agent te coute de l'argent. Si l'agent tourne pendant deux heures sur 50 documents, la facture suit. Le 25 aout 2026, Perplexity et NVIDIA ont lance Portable Computer : un agent IA qui fait tout ce travail sur ta machine, pas dans le cloud. Le compteur de credits reste a zero.
Ce qu'est Portable Computer
Portable Computer est une version locale de l'agent Computer de Perplexity. Computer, c'est la plateforme agentique de Perplexity : elle orchestre des modeles, des fichiers, des outils et un acces web pour completer des taches multi-etapes. Analyser des dossiers, produire des rapports, pousser des resultats dans des outils metier. Portable Computer replique cette experience en local. Le modele, l'agent, le moteur d'inference, les outils et le sandbox de securite sont empaquetes dans une seule application.
La difference avec un stack local bricole : tout est inclus. Pas besoin de telecharger les poids d'un modele, de monter un serveur d'inference, de brancher des outils et de regler les performances. Perplexity a fait le bundle pour que l'agent soit operationnel en quelques minutes.
Le lancement s'est fait en partenariat etroit avec NVIDIA. La cible materielle au depart : le DGX Spark, le supercalculateur de bureau de NVIDIA, et les machines Linux equipees d'un GPU RTX. Le seuil minimum : 24 Go de VRAM, ce qui correspond a une GeForce RTX 3090 ou plus recent. Windows arrive en septembre 2026.
Pourquoi le local devient viable pour les agents
Pendant deux ans, l'IA locale etait un terrain de hobbyistes. On faisait tourner des modeles quantifies, reduits pour tenir dans la memoire video, et on se contentait de reponses correctes mais limitees. NVIDIA et Perplexity disent que c'ai change. Les modeles ouverts de 2026 (Qwen 3.8 27B, Nemotron 3.5 Lightning, PPLX 27B) sont assez bons pour du vrai travail agentique en local.
L'autre raison, c'est l'economie des agents. Un chat, c'est bursty : une question, une reponse, fini. Un agent, c'est different. Il tourne longtemps, verifie, re-verifie, itere. Plus il consomme de tokens, mieux il travaille. En cloud, cette boucle te coute cher. En local, le cout marginal d'un token approche zero. Tu as paye le materiel, pas l'usage.
Nader, directeur de la technologie developpeur chez NVIDIA, le dit crument : "On voit une demande insatiable de tokens. C'est ça qui rend l'IA locale si interessante. Tu n'etais pas facture au token dans les demos. Tu ne payais pas pour le token."
Comment ça marche en pratique
Au lancement, deux modeles sont disponibles : Qwen 3.8 27B et PPLX 27B, une version que Perplexity a post-entrainee sur son propre harness. Nemotron 3.5 Lightning de NVIDIA arrive prochainement. L'inference tourne via vLLM, avec un mode avance pour qui veut brancher son propre endpoint.
L'agent se connecte a Google Drive, Gmail, GitHub et Slack. Il peut analyser un CSV en local, puis pousser le resultat sur Slack. Local-first ne veut pas dire deconnecte.
La partie interessante, c'est l'escalade. Quand le modele local atteint ses limites, l'agent peut basculer vers un modele frontier dans le cloud. Mais il doit te demander la permission avant chaque appel. Avant que quoi que ce soit ne quitte ta machine, un classifieur de donnees confidentielles (PII) verifie le contexte sortant et te montre exactement ce qui serait envoye. Le modele distant recoit du texte, jamais tes fichiers ni tes outils.
Les benchmarks que Perplexity publie
Perplexity a publie un papier de recherche avec ses propres evaluations. Sur son benchmark interne (53 taches de travail de connaissance : recherche profonde, analyse financiere, creation de documents), Computer avec Qwen 3.8 27B sur un DGX Spark score 82,6%. Le harness open source Pi score 77,6% avec le meme modele. Hermes, un autre harness, score 74,0%.
La version post-entrainee PPLX 27B monte a 85,4%. Sur BrowseComp (benchmark de recherche web), Computer atteint 66,7% contre 50,2% pour Pi et 43,9% pour Hermes, en utilisant 51% moins de temps et 70% moins de tokens que Pi.
Le point le plus parlant concerne le mode hybride. Sur Terminal Bench 2.1 (benchmark de code), le modele local seul score 59,6% a cout marginal zero. En autorisant l'escalade vers Claude Opus 5 en cloud comme conseiller, le score monte a 73,0% pour un cout estime a 0,415$ par tache. Le modele frontier seul score 82,4% a 0,65$ par tache. L'escalade recupere grosso modo trois cinquiemes de l'ecart avec le frontier, pour deux tiers du prix. Et c'est toi qui decides quand le trade vaut le coup.
Le detail qui compte : le harness est co-concu avec le modele
Perplexity insiste sur un point : un bon agent local, c'est pas un modele ouvert branche dans un harness generique. Les harnesses generalistes supposent un modele frontier capable d'absorber des contextes enormes, naviguer des dizaines d'outils et planifier sur de longs horizons. Les petits modeles locaux cassent sous cette charge.
En pratique, Qwen 3.8 27B annonce 260 000 tokens de fenetre de contexte mais commence a peiner au-dela de 100 000. Perplexity a donc construit un harness minimaliste : un system prompt court, un petit set d'outils centraux, et des competences qui se chargent et se dechargent a la demande au lieu de rester en permanence dans le contexte. Les connecteurs Gmail et GitHub ont ete convertis de serveurs MCP gourmands en tokens vers des outils en ligne de commande compacts.
Cote securite, le sandbox OS est toujours actif. Si le sandbox n'est pas disponible, le harness se desactive plutot que de faire tourner des outils sans protection. C'est un contraste avec les harnesses open source qui font tourner les commandes avec les permissions completes de l'utilisateur par defaut.
Un exemple chez Maisons&Mobilia
Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), veut analyser les retours clients de l'e-commerce. Volume : 500 retours par semaine. Elle a un DGX Spark sur son bureau.
Avec un agent cloud, chaque analyse de retour coute quelques centimes de tokens. Sur 500 retours avec 6 appels de modele chacun, la facture mensuelle tourne autour de 120 euros. Avec Portable Computer, l'agent tourne en local sur Qwen 3.8 27B. Le cout : zero par token. L'abonnement Perplexity Pro, deja paye pour d'autres usages, couvre l'acces.
Sur les 500 retours, 470 sont des cas standards (defaut produit, retard livraison, taille incorrecte). Le modele local les gere bien. Pour les 30 restants (motifs mixtes, retours touchant a la reglementation), Sophie clique sur "escalader" et l'agent envoie le contexte au modele frontier apres qu'elle a valide ce qui sort de sa machine.
La limite : le DGX Spark coute plusieurs milliers d'euros. L'economie sur les tokens est reelle mais il faut amortir le materiel. Et si Sophie n'a pas de GPU 24 Go, elle ne peut pas utiliser Portable Computer. Le local, en 2026, reste reserve a ceux qui ont la machine.
Ce que ça change si tu apprends l'IA
Portable Computer illustre un basculement qui devient evident en 2026 : la frontiere entre local et cloud se deplace. Ce n'est plus "le cloud pour les choses serieuses, le local pour l'experimentation". C'est "le local par defaut, le cloud pour les cas qui le meritent".
Pour l'audience de saisir.ai, trois notions concretes ressortent :
- Local vs cloud : comprendre ou tourne ton IA, c'est comprendre qui a acces a tes donnees et combien ça coute. Portable Computer pousse la question au centre : par defaut, rien ne sort de ta machine.
- Escalade : c'est un cas d'orchestration. Le modele local gere le volume, le frontier gere la difficulte. L'agent decide (ou tu decides) quand basculer. C'est le system of models applique a un seul appareil.
- Sandbox et moindre privilege : le harness se desactive si le sandbox n'est pas disponible. Les outils tournent isoles, pas avec tes permissions completes. C'est le moindre privilege applique au local.
La competence pratique, c'est de savoir quand un modele local suffit et quand il faut escalader. Pas choisir "le plus puissant" (ça coute), mais le bon niveau pour chaque tache.
Aller plus loin
Pour comprendre comment un agent IA utilise des outils et enchaine des etapes, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous concrets a mettre en place quand un agent accede a tes donnees, le guide sur les garde-fous des agents IA detaille le moindre privilege et le human in the loop. Et pour t'entrainer a ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les agents, le tool use et les modeles locaux, en francais, sans coder.
Sources
- VentureBeat, "Perplexity partners with Nvidia to launch Portable Computer, a fully local AI agent with zero token costs", 25 aout 2026
- The Verge, "Perplexity's new Portable Computer runs entirely on device", 25 aout 2026
- Perplexity, "A local-first agent for private and cost-effective knowledge work", papier de recherche, 25 aout 2026
- The Deep View, "Why Perplexity just launched a local agent with Nvidia", 25 aout 2026
- Gizmodo, "Perplexity Launches Local AI Model That Will Run on Your GPU Instead of the Cloud", 25 aout 2026
Questions fréquentes
- C'est quoi Perplexity Portable Computer ?
- Portable Computer est une version locale de l'agent IA Computer de Perplexity, lancee le 25 aout 2026 avec NVIDIA. Elle tourne entierement sur ta machine : le modele, les fichiers et l'agent restent en local. Tu n'as pas besoin de cloud, et chaque tache commence sur l'appareil par defaut.
- Quelle matiere il faut pour faire tourner Portable Computer ?
- Il faut une machine Linux avec un GPU NVIDIA RTX ayant au moins 24 Go de VRAM, ce qui correspond grosso modo a une GeForce RTX 3090 ou plus recent. Le DGX Spark de NVIDIA est le materiel de reference au lancement. Windows arrive en septembre 2026.
- Portable Computer coute-t-il quelque chose ?
- L'agent lui-meme necessite un abonnement Perplexity (Pro, Max, Enterprise Pro ou Enterprise Max). Mais une fois en local, les tokens consommes par l'agent sont gratuits : le compteur de credits reste a zero. Tu paies l'abonnement et le materiel, pas l'usage.
- Est-ce que Portable Computer peut quand meme utiliser le cloud ?
- Oui. Quand le modele local atteint ses limites, l'agent peut escalader vers un modele frontier dans le cloud, mais il doit te demander la permission avant. Avant chaque appel au cloud, un classifieur de donnees confidentielles (PII) verifie ce qui va sortir de ta machine et te montre exactement ce qui serait envoye.
- Quels modeles Portable Computer utilise-t-il ?
- Au lancement, tu peux utiliser Qwen 3.8 27B ou PPLX 27B (une version post-entrainee par Perplexity). Le modele Nemotron 3.5 Lightning de NVIDIA arrive prochainement. L'agent utilise vLLM pour l'inference en local.