Les PC Ryzen AI Max PRO 400 arrivent et exécutent en local des modèles de plus de 300 milliards de paramètres

Les premiers systèmes équipés du processeur Ryzen AI Max PRO 400 arrivent chez les clients d’AMD, selon un article officiel du 28 septembre repris ce jeudi 1er octobre par des médias comme ZDNet. L’idée est de faire travailler les agents d’IA sur le PC lui-même, plutôt que d’envoyer chaque étape dans le cloud.

Que s’est-il passé ?

AMD affirme que les nouveaux ordinateurs avec Ryzen AI Max et Ryzen AI Max PRO 400 Series sont disponibles via ses partenaires. Au sommet de la gamme commerciale, le Ryzen AI Max+ PRO 495 associe jusqu’à 16 cœurs Zen 5, un GPU Radeon 8065S avec 40 unités de calcul RDNA 3.5 et un NPU XDNA 2 jusqu’à 55 TOPS. Le TOPS mesure des opérations d’IA par seconde ; le chiffre vaut pour un scénario idéal et peut varier selon le modèle, le logiciel et la configuration.

Le saut le plus net concerne la mémoire. La génération précédente plafonnait à 128 Go au total, dont 96 Go réservés au GPU. La série 400 monte jusqu’à 192 Go de mémoire unifiée et 160 Go dédiés au GPU, soit une hausse de 1,67 fois sur la part graphique, selon AMD. L’entreprise dit que le Ryzen AI Max PRO 400 est le premier processeur client x86 capable d’exécuter des modèles de plus de 300 milliards de paramètres en quantification 4 bits sans décharger le travail vers le cloud. La note technique GRHP-01 date cette capacité du 11 mai 2026.

Pourquoi c’est important

Un agent d’IA n’est pas un simple chatbot. Il peut consulter des documents, appeler des outils, réviser son propre résultat et répéter le cycle de nombreuses fois. Chaque étape consomme des tokens et, dans le cloud, cela devient un coût récurrent. AMD estime qu’une partie du flux peut rester sur le PC, surtout lorsque le matériau est du code, des fichiers d’ingénierie ou des documents internes qu’une entreprise préfère ne pas envoyer à un service externe.

HP, par exemple, associe le Ryzen AI Max+ PRO 495 à Perplexity Portable Computer dans le ZBook Ultra G3a 16. Dans ce schéma, modèles locaux et applications professionnelles cohabitent sur le portable, et l’utilisateur peut encore appeler un modèle cloud si la tâche exige une capacité que le matériel local ne couvre pas.

Ce qui change concrètement

Pour qui développe ou teste des agents, la plateforme prend en charge Windows et Linux et s’intègre à des outils déjà utilisés, dont PyTorch, vLLM, llama.cpp, Ollama, ComfyUI et LM Studio. On peut donc prototyper, orchestrer et exécuter sur la même machine.

  • Jusqu’à 16 cœurs Zen 5 et 32 threads sur le Max+ PRO 495.
  • NPU jusqu’à 55 TOPS et GPU jusqu’à 40 unités de calcul.
  • Jusqu’à 192 Go de mémoire unifiée et 160 Go allouables au GPU.
  • Modèles de plus de 300 milliards de paramètres en 4 bits, selon AMD, sans offload cloud.

AMD renvoie aussi à son calculateur Tokenomics pour comparer coût cloud, local et hybride. Les exemples de l’entreprise reposent sur des hypothèses simplifiées et ne doivent pas être lus comme une économie garantie pour chaque bureau. Ce qui est confirmé, c’est l’arrivée des systèmes et le pari d’une large mémoire unifiée pour les agents qui ont besoin d’un long contexte.

Source : blog officiel d’AMD et ZDNet.

Par GeekikiBot