High-Tech

À la une

Apple veut transformer le Mac Studio en mini-datacenter IA : quatre machines, Thunderbolt 5 et des modèles géants en local

Le Mac Studio n’est plus seulement la petite boîte hors de prix que les monteurs vidéo posent à côté de trois écrans 5K. Avec la génération M5 Ultra, Apple pousse beaucoup plus franchement son ordinateur vers l’IA locale : jusqu’à 512 Go de mémoire unifiée par machine, 1,2 To/s de bande passante mémoire et surtout la possibilité de relier plusieurs Mac Studio en Thunderbolt 5 avec RDMA. Apple affirme qu’un cluster de quatre machines peut accélérer l’inférence jusqu’à trois fois, tandis que Reuters a vu la société faire tourner sur quatre Mac Studio un modèle comptant un billion de paramètres à partir d’une seule prise murale. Le PC de bureau commence doucement à ressembler à un mini-datacenter.

11 min de lecture 0 commentaire
Apple veut transformer le Mac Studio en mini-datacenter IA : quatre machines, Thunderbolt 5 et des modèles géants en local

Il y a encore quelques années, « faire tourner une IA en local » voulait généralement dire lancer un modèle suffisamment petit pour tenir dans les 8 ou 12 Go de VRAM de sa carte graphique, regarder les ventilateurs prendre leur envol et se féliciter lorsque la réponse arrivait avant le prochain changement d’heure.

Depuis, les choses ont quelque peu changé.

Les modèles se sont améliorés, les quantifications également, et des outils comme Ollama, LM Studio ou MLX ont transformé l’IA locale en quelque chose d’accessible sans posséder un rack de GPU dans le garage. Mais dès que l’on veut charger des modèles réellement énormes, la même limite revient toujours frapper à la porte : la mémoire.

Et c’est précisément sur ce terrain qu’Apple semble vouloir jouer avec son nouveau Mac Studio.

La machine équipée de la puce M5 Ultra peut embarquer jusqu’à 512 Go de mémoire unifiée, avec une bande passante annoncée de 1,2 To/s. Apple indique que cette configuration permet d’exécuter localement de très grands modèles de langage comptant plusieurs centaines de milliards de paramètres, sans que les données aient besoin de quitter la machine.

512 Go dans un ordinateur posé sur un bureau, c’est déjà respectable.

Mais Apple a décidé que ce serait encore plus amusant si on pouvait en brancher quatre ensemble.

Le Thunderbolt sert maintenant à fabriquer un cluster

La nouveauté réellement intéressante n’est donc pas seulement la M5 Ultra. C’est la prise en charge du RDMA via Thunderbolt 5.

RDMA signifie Remote Direct Memory Access. L’idée générale consiste à permettre à une machine d’accéder aux données présentes dans la mémoire d’une autre avec beaucoup moins d’interventions du processeur et de copies intermédiaires qu’avec une communication réseau classique.

Dans le nouveau Mac Studio, Apple utilise cette technologie afin de relier plusieurs machines par Thunderbolt 5 et de créer ce que l’entreprise décrit comme un vaste pool de mémoire partagé destiné aux charges de travail d’intelligence artificielle. Apple affirme qu’un ensemble de quatre Mac Studio peut offrir jusqu’à trois fois les performances d’inférence d’un Mac Studio isolé.

Chaque Mac Studio M5 Ultra pouvant être configuré avec 512 Go de mémoire unifiée, quatre machines peuvent représenter jusqu’à 2 To de mémoire cumulée.

Évidemment, « 2 To répartis sur quatre ordinateurs connectés par Thunderbolt » n’est pas exactement équivalent à 2 To soudés directement sur une seule puce. Il existe forcément des différences de latence, de bande passante et de fonctionnement entre la mémoire locale et la mémoire accessible sur une autre machine.

Mais la possibilité de distribuer suffisamment proprement un modèle massif sur quatre ordinateurs compacts change déjà pas mal de choses.

Le câble Thunderbolt qui servait hier à brancher un SSD externe vient donc officiellement d’obtenir une deuxième carrière dans le calcul distribué.

Apple a sorti le modèle à un billion de paramètres

C’est là que la démonstration rapportée par Reuters devient particulièrement intéressante.

Lors de la présentation de ses nouvelles machines, Apple a relié quatre Mac Studio afin de faire fonctionner un modèle d’intelligence artificielle comptant environ un billion de paramètres — soit un trillion selon la terminologie anglo-saxonne. Le modèle a été utilisé pour rechercher puis corriger un bug graphique dans du code.

Le plus amusant est peut-être le détail suivant : selon Reuters, l’ensemble des quatre machines fonctionnait à partir d’une seule prise murale.

Alors évidemment, ce n’est pas exactement le genre de cluster que l’on va acheter pour lui demander :

« Quelle quantité de pâtes pour quatre personnes ? »

L’intérêt vise plutôt les développeurs, chercheurs et entreprises qui manipulent des modèles open-weight de très grande taille et souhaitent éviter de louer en permanence des GPU dans le cloud.

Et Apple ne se cache pas vraiment de cet angle commercial.

Johny Srouji, responsable matériel de l’entreprise, a expliqué à Reuters qu’une fois la machine achetée, il n’existe plus de facturation au token : le matériel peut simplement être réutilisé pour autant d’inférences que nécessaire.

C’est évidemment le discours du constructeur qui cherche à vendre des Mac.

Mais le calcul économique mérite quand même qu’on s’y intéresse.

Le token gratuit qui coûte tout de même quelques milliers d’euros

Faire tourner un modèle chez OpenAI, Anthropic ou un autre fournisseur cloud fonctionne généralement selon une logique assez simple : plus le modèle traite de tokens, plus la facture augmente.

Avec une machine locale, le modèle économique est inversé. Vous payez cher au départ, puis vous absorbez essentiellement l’électricité, la maintenance et le coût d’amortissement du matériel.

En France, le nouveau Mac Studio démarre à 2 999 € avec une M5 Max. La version M5 Ultra commence à 6 599 €. Apple indique par ailleurs que l’option permettant de monter jusqu’à 512 Go de mémoire unifiée doit être disponible fin octobre.

Construire un cluster de quatre M5 Ultra ne constitue donc pas exactement une activité recommandée pour finir le mois avec un compte bancaire épanoui.

Même en prenant uniquement le prix d’entrée de la version Ultra, quatre machines représentent déjà plus de 26 000 € avant d’avoir commencé à cocher les grosses options mémoire et stockage.

À ce niveau, appeler ça un « ordinateur personnel » devient presque une question philosophique.

Mais pour une société qui dépense continuellement des milliers d’euros par mois en inférence cloud, la comparaison devient beaucoup moins absurde. Reuters rapporte précisément qu’Apple cible des entreprises avec l’argument selon lequel ses nouvelles machines peuvent, dans certains cas, revenir moins cher que la location continue d’infrastructures distantes.

Le véritable avantage d’Apple s’appelle mémoire unifiée

Si les Mac sont devenus intéressants pour l’IA locale, ce n’est pas uniquement parce qu’Apple colle des accélérateurs neuronaux partout où elle trouve encore quelques transistors disponibles.

L’architecture Apple Silicon utilise une mémoire unifiée, partagée par le CPU, le GPU et d’autres unités de calcul.

Sur une machine équipée d’une carte graphique classique, le GPU possède généralement sa propre VRAM. Si votre carte dispose de 24 Go et que le modèle en demande 40, vous devez trouver une solution : répartir le modèle, décharger certaines couches vers la RAM système ou acheter un matériel disposant de davantage de mémoire graphique.

Sur les Mac Apple Silicon, CPU et GPU travaillent dans le même espace mémoire. Le framework open source MLX , développé par les équipes de recherche d’Apple, est précisément conçu autour de cette architecture : ses tableaux vivent en mémoire partagée et peuvent être utilisés par les différents dispositifs de calcul sans les mêmes opérations de copie entre RAM système et VRAM séparée.

C’est ce qui explique en grande partie pourquoi un Mac équipé de 128, 256 ou 512 Go de mémoire peut devenir particulièrement intéressant pour charger de très gros modèles.

Pas nécessairement parce qu’il calculera plus rapidement qu’une énorme ferme de GPU Nvidia.

Mais simplement parce que le modèle rentre dedans.

Et, en intelligence artificielle locale, c’est déjà une qualité assez importante.

MLX devient le CUDA maison d’Apple… avec quelques différences

Apple pousse d’ailleurs de plus en plus sérieusement MLX.

Le framework est open source sous licence MIT et propose notamment des interfaces Python, C++, C et Swift. Sa philosophie se rapproche d’outils comme NumPy, PyTorch ou JAX tout en étant spécifiquement optimisée pour Apple Silicon.

Apple introduit également avec cette génération Core AI, un nouveau framework destiné à construire, exécuter et déployer des modèles sur ses puces. Le constructeur présente désormais le Mac Studio comme une plateforme complète allant de l’expérimentation jusqu’au déploiement local des modèles.

La stratégie devient assez lisible.

Apple possède le processeur.

Apple possède le GPU.

Apple possède le Neural Engine.

Apple contrôle la mémoire.

Apple contrôle macOS.

Et Apple développe désormais une partie croissante de la couche logicielle IA située au-dessus.

C’est une intégration verticale presque caricaturale.

Mais pour optimiser du calcul local, disposer de l’ensemble de la pile sous le même toit peut avoir certains avantages.

Le Mac Studio n’est plus seulement une machine de créatif

Lorsque le premier Mac Studio est arrivé, son public paraissait assez évident : montage vidéo, audio professionnel, rendu 3D, photographie et autres workloads créatifs.

La génération actuelle continue évidemment à cibler ces usages. Mais le vocabulaire d’Apple a clairement changé.

L’entreprise parle maintenant beaucoup de LLM, d’inférence distribuée, de modèles open-weight et de clusters.

La M5 Ultra monte jusqu’à 36 cœurs CPU, 80 cœurs GPU, 512 Go de mémoire unifiée et 1,2 To/s de bande passante mémoire. Thunderbolt 5 atteint jusqu’à 120 Gbit/s, tandis que RDMA permet désormais d’exploiter plusieurs Mac Studio ensemble pour les workloads distribués.

Ce n’est plus simplement « regardez comme Final Cut exporte rapidement votre vidéo ».

Apple veut manifestement convaincre les équipes IA qu’une partie de leur infrastructure peut désormais vivre… sur un bureau.

Reuters décrit d’ailleurs cette nouvelle offensive comme une tentative de concurrencer davantage les systèmes Windows et les offres Nvidia destinées aux charges IA locales et professionnelles.

L’IA locale revient par la très grande porte

Le mouvement dépasse évidemment Apple.

Pendant les premières années du boom de l’IA générative, la tendance semblait assez évidente : tout allait finir dans d’immenses datacenters et nos ordinateurs locaux deviendraient essentiellement des terminaux permettant d’appeler des API.

Puis les modèles ouverts sont devenus meilleurs.

Les quantifications ont progressé.

Les accélérateurs locaux se sont multipliés.

Et les utilisateurs ont commencé à découvrir qu’un modèle disponible en permanence sur leur propre machine présentait quelques qualités sympathiques : aucune facturation à la requête, pas de dépendance permanente à une API et, pour certains usages, la possibilité de conserver les données localement.

La nouvelle génération de Mac Studio pousse simplement cette logique jusqu’à un niveau légèrement déraisonnable.

Un Mac : une station IA locale.

Deux Mac : quelqu’un commence à devenir sérieux.

Quatre Mac reliés en Thunderbolt 5 : félicitations, le bureau commence à demander son propre administrateur système.

Mais non, le datacenter n’est pas mort

Il ne faudrait évidemment pas conclure que quatre Mac Studio vont remplacer demain les clusters Nvidia remplissant des bâtiments entiers.

L’entraînement des modèles géants, les services utilisés simultanément par des millions de personnes et les charges demandant des quantités astronomiques de GPU continueront à vivre dans des datacenters.

Le Mac Studio vise autre chose : rapprocher des capacités autrefois réservées à des serveurs spécialisés d’une station de travail locale ou d’un petit cluster d’entreprise.

C’est assez différent.

Une équipe de développement n’a pas forcément besoin de former le prochain GPT. Elle peut simplement vouloir exécuter un gros modèle de code interne, analyser des documents, tester un modèle open-weight ou fournir une IA locale à une poignée d’ingénieurs.

Dans ce contexte, posséder le matériel peut devenir une option crédible.

À condition, évidemment, d’avoir le budget.

Et une prise électrique plutôt confiante.

Le PC de demain pourrait surtout être un serveur IA posé sur le bureau

Il y a quelque chose d’assez amusant dans l’évolution actuelle du marché informatique.

Pendant des années, l’industrie nous a expliqué que la puissance locale comptait de moins en moins parce que tout partirait dans le cloud.

Puis elle a découvert l’intelligence artificielle.

Et maintenant Apple nous montre quatre ordinateurs à plusieurs milliers d’euros reliés par des câbles pour recréer un petit cluster de calcul sur le bureau.

Finalement, le cloud aura peut-être surtout servi à nous rappeler à quel point il est agréable de posséder ses propres ordinateurs.

Le nouveau Mac Studio M5 Ultra reste une machine inaccessible et totalement disproportionnée pour la majorité des utilisateurs. Mais ses 512 Go de mémoire unifiée, son support du RDMA et la possibilité d’assembler plusieurs unités sont révélateurs d’un changement plus large.

L’IA locale n’est plus simplement le petit modèle quantifié que l’on lance pour jouer le week-end.

Elle commence progressivement à devenir une véritable catégorie d’infrastructure informatique.

Et si votre prochain datacenter tient sous l’écran, pensez quand même à lui laisser un peu d’espace pour respirer.

Sources & références

Tags

Communauté

Commentaires

La discussion est ouverte

Aucun commentaire pour le moment. Soyez le premier à réagir.

Publication après modération