taraskuzio.com

ROCm.ai, ou comment AMD inculque sa stack aux LLM

Rendez-vous en août pour la sortie de ROCm.ai.

AMD a fixé le rendez-vous à l’occasion de sa conférence Advancing AI. La promesse : de la programmation GPU assistée par IA. Avec, comme principaux leviers, des skills et un système appelé Hyperloom.

AMD met à contribution son serveur Lemonade

Six skills sont pour le moment disponibles. On les retrouve dans les catalogues de plug-in de Claude et de Codex, ainsi que sur la marketplace Cursor.

Deux de ces skills ciblent l’exécution côté client, sur les puces Ryzen AI : Local AI Use et Local AI App Integration.

Local AI Use fait passer la génération d’images ainsi que la synthèse et la reconnaissance vocales par un serveur Lemonade local. Les agents sont invités à l’exploiter, entre autres, lorsque l’utilisateur déclare vouloir économiser des tokens ; ou s’il mentionne des éléments comme OmniRouter, SD-Turbo ou l’inférence NPU.

Local AI App Integration ajoute un mode local aux applications qui utilisent des API cloud, grâce à une version embarquée du serveur Lemonade. Les agents sont censés l’exploiter lorsque l’utilisateur évoque l’IA locale, hors ligne, privée, etc.

Les quatre autres skills ciblent l'exécution côté serveur. Deux d'entre elles créent un endpoint vLLM, respectivement sur les GPU Instinct et sur les CPU EPYC. AMD précise aux agents que la skill Instinct... ne doit pas être utilisée avec les GPU NVIDIA.

Les deux skills restantes sont connectées à Magpie (framework d'évaluation de noyaux GPU) et TraceLens (bibliothèque Python pour l'analyse de workflows d'inférence et d'entraînement).

5 autres skills dans les cartons

Quatre skills cross-stack sont en roadmap :

  • ROCm Doctor
    Diagnostic des échecs ROCm, PyTorch et llama.cpp sur les GPU AMD à partir d'une liste de mauvaises configurations
  • Hyperloom Kernel Optimizer
    Optimisation automatique de l'inférence sur les GPU AMD
  • vLLM Semantic Router
    Paramétrage d'un routeur de requêtes
  • HRR Replay Analysis
    Enregistrement, rejeu et analyse des workloads GPU entre accélérateurs Instinct, Radeon et Ryzen

AMD en prépare aussi une sur la partie client : APU Memory Tuner, avec laquelle les agents IA pourront régler la répartition entre mémoire dédiée et mémoire partagée.

Claude Code intégré au cœur du réacteur Hyperloom

On l'aura constaté : plusieurs de ces skills permettent d'exploiter le fameux Hyperloom. Ce système agentique a, sur le papier, un rôle : optimiser les workloads IA pour les GPU AMD (en l'état, MI300X, MI325X et MI355X). Il gère actuellement deux serveurs (SGLang, vLLM) et trois langages (HIP, Triton, FlyDSL).


architecture Hyperloom AMD

Au bas de l'édifice se trouve TraceLens. La bibliothèque - agrémentée pour le coup d'une couche agentique - consomme les traces collectées par Magpie, qui s'appuie lui-même sur Intellikit (suite d'outils de profilage à bas niveau).

Cette analyse nourrit la boucle d'optimisation. La brique GEAK (Generating Efficient AI-Centric Kernels) en est le point central, chargée de générer les implémentations. À l'origine, elle optimisait noyau par noyau (« couche kernel ») La dernière version conserve cette option, mais peut aussi optimiser un workload dans son ensemble (« couche système »). Plusieurs modifications architecturales le permettent. En particulier, le remplacement de mini-swe-agent par Claude Code et ses workflows dynamiques. Mais aussi la réutilisation récursive de la couche kernel par la couche système (AMD parle de « conception fractale »). Et l'introduction d'Arbor. Cette méthode favorise l'exploration de l'espace d'optimisation en apportant un système de recherche arborescente qui fait office de mémoire de travail partagée.


GEAK v4 workflow kernel


GEAK v4 workflow e2e

Au-delà d'utiliser Claude Code dans le cadre d'Hyperloom, AMD l'exploite pour accélérer le développement de ROCm. Il travaille aussi avec OpenAI autour de Codex, qui « aide déjà à écrire du code Triton » et « progresse » avec Gluon.

À consulter en complément :

LLMD, un serveur d'inférence made in France qui se frotte à vLLM
PC IA : le NPU, emblème d'un marché qui se cherche encore
Jalapeño plutôt que Stargate : OpenAI a revu ses priorités
Meta mise des dizaines de milliards sur les GPU d'AMD
VM cloud : AMD reste dans le match du rapport coût-performance

Illustration principale générée par IA