20/08/2026

oMLX – Faites tourner vos agents IA en local sur votre Mac

Par admin

oMLX – Faites tourner vos agents IA en local sur votre Mac

Faire tourner un modèle en local

sur un Mac, c’est réglé depuis un moment. Ce qui l’est moins par contre, c’est de brancher un agent de code dessus, parce qu’à chaque reprise de session, le serveur doit malheureusement remouliner des dizaines de milliers de tokens de contexte avant de sortir le premier mot…

Ce calcul, ça s’appelle le cache KV, et la plupart des serveurs le gardent en mémoire. Du coup, quand le modèle se décharge, le cache part avec dans le grand vide…

C’est pourquoi

oMLX

a pris le parti d’écrire ce cache sur le disque, au format safetensors, car le contexte déjà envoyé une fois, prompt système et fichiers lus compris, se recharge depuis le SSD au lieu d’être recalculé, y compris après un redémarrage du serveur.

De son côté,

LM Studio conserve lui aussi son cache MLX sur disque

, mais dans un fichier temporaire qu’il efface quand le modèle se décharge. Les deux outils écrivent sur le disque, mais un seul conserve réellement son cache.

Côté raccordement, le serveur oMLX

expose l’API OpenAI

et l’API Anthropic ce qui permet par exemple à Claude Code de taper directement sur localhost. Et y’a même un tableau de bord qui nous dit quoi faire dans le terminal pour brancher Claude Code ou d’autres avec oMLX.

Sur oMLX, le cache disque est donc actif d’office et son plafond par défaut, parce qu’il en faut bien un, se calcule à 10 % de la capacité du disque qui l’héberge. Sur un SSD d’un téraoctet par exemple, ça fait cent gigaoctets qui peuvent partir en cache sans que personne n’ait rien demandé. Donc prévoyez un peu de place… Après rassurez-vous, ça se vide d’un clic sur un bouton dans le tableau de bord et la taille peut se régler.

Le deuxième piège est plus sournois puisqu’une installation par défaut via pip ne compile pas les kernels Metal, et les modèles GLM-5.2, MiniMax M3 et Qwen3.5 retombent alors sans prévenir sur un chemin générique… Donc je vous incite fortement à utiliser uniquement les DMG proposés qui contiennent déjà les kernels Metal compilés comme il faut.

Reste à savoir ce que ça donne vraiment dans un usage quotidien… Le cache attaque l’attente avant le premier mot mais pas la vitesse à laquelle les mots sortent ensuite donc tout dépend du modèle et de la machine que vous avez. Mais en tout cas, pour un usage avec des agents (coding par exemple), ce sera plus efficace d’utiliser oMLX que Ollama ou LMStudio.

Source :

omlx.ai

Source : korben.info