Lors de la Jamf Nation User Conference (JNUC), un rassemblement annuel dédié aux administrateurs informatiques du monde Apple, une diapositive a circulé dans la salle avant d'être photographiée et relayée sur X par @aaronp613. Le document, qui ne provient donc pas d'une communication officielle d'Apple mais d'une présentation technique destinée à un public professionnel, détaille pour la première fois une échelle précise : combien de paramètres un modèle de langage peut activer selon l'appareil Apple sur lequel il tourne, de l'iPhone au cluster de plusieurs Mac Studio.
Six paliers, de 14 à 1 600 milliards de paramètres
Le tableau distingue six catégories de matériel, chacune associée à une quantité de mémoire unifiée, une bande passante et un nombre maximal de paramètres dits « actifs ». Sur iPhone et iPad, Apple recommande jusqu'à 16 Go de mémoire unifiée et une bande passante de 76 Go/s pour faire tourner des modèles allant jusqu'à 14 milliards de paramètres actifs, de quoi couvrir Siri, la correction de texte ou le traitement d'images en local.
Ce plafond de 16 Go mérite une précision, car aucun iPhone actuel ne l'atteint. L'iPhone 18 Pro, lancé ce mois-ci avec la puce A20 Pro, embarque 12 Go de RAM, à l'identique de l'iPhone 17 Pro : pas de progression cette génération, dans un contexte de crise de puces mémoire qui touche l'ensemble de l'industrie. Les 16 Go évoqués par Apple correspondent en réalité au haut de la gamme iPad Pro M5, mais uniquement sur ses configurations 1 To et 2 To ; les versions 256 Go et 512 Go se contentent, elles aussi, de 12 Go. Le chiffre du tableau décrit donc un plafond de catégorie porté par l'iPad, pas une caractéristique que l'iPhone atteint aujourd'hui. Côté bande passante en revanche, l'A20 Pro dépasse déjà largement la recommandation d'Apple, avec 115,2 Go/s mesurés, ce qui confirme que c'est bien la capacité mémoire, et non la vitesse d'accès, qui borne les modèles exécutables sur iPhone.
La progression s'accélère ensuite sur les Mac. Le MacBook Air (32 Go, 153 Go/s) monte à 35 milliards de paramètres, le Mac mini (64 Go, 307 Go/s) double la mise à 70 milliards, et le MacBook Pro haut de gamme (128 Go, 614 Go/s) atteint 120 milliards. Le Mac Studio équipé d'une puce M5 Ultra change ensuite d'échelle avec 512 Go de mémoire unifiée, 1,2 To/s de bande passante et jusqu'à 480 milliards de paramètres actifs. Tout en haut du tableau, un cluster de quatre Mac Studio reliés entre eux cumule 2 To de mémoire et grimpe jusqu'à 1 600 milliards de paramètres, soit un ordre de grandeur qui rivalise avec les plus gros modèles fermés disponibles dans le cloud.
Mac mini M6 : les premiers benchmarks IA montrent des progrès fulgurants
Cette montée en puissance a un prix qui refroidit vite l'enthousiasme. En France, le Mac Studio M5 Ultra démarre à 6 599 € pour sa configuration d'entrée (30 cœurs CPU, 64 cœurs GPU, 96 Go de mémoire, 1 To de SSD). La configuration maximale évoquée pour atteindre les 480 milliards de paramètres, avec 36 cœurs CPU, 80 cœurs GPU et 512 Go de mémoire, grimperait aux alentours de 12 800 € pièce en appliquant le même écart de prix qu'Apple applique habituellement entre ses tarifs américains et français ; un cluster de quatre unités avoisinerait donc les 51 800 €, et il faudrait franchir la barre des 100 000 € pour un cluster de huit machines capable de faire tourner un modèle à 1 000 milliards de paramètres. Ces montants restent des estimations, la configuration exacte évoquée par Apple n'étant pas encore commercialisée au moment de la rédaction de cet article.
Comment le Mac s’est imposé dans l’IA
Ce que cache la notion de « paramètres actifs »
Le terme mérite d’être expliqué, car il change tout à la lecture de ce tableau. Un modèle de langage peut afficher plusieurs centaines de milliards de paramètres au total tout en n'en activant qu'une fraction à chaque requête, une architecture dite de mélange d'experts. C'est cette portion active qui détermine principalement la quantité de calculs effectués pour chaque token. Elle ne correspond toutefois pas nécessairement à la mémoire totale nécessaire pour charger le modèle : dans une architecture MoE, les poids des experts inactifs doivent eux aussi être conservés quelque part, généralement en mémoire, même s'ils ne participent pas à chaque opération. Un modèle annoncé à 14 milliards de paramètres actifs peut donc, en théorie, appartenir à une famille de modèles bien plus vaste sur le papier.
Cette distinction explique aussi pourquoi la mémoire prime sur la puissance brute du processeur dans cet exercice. Le modèle doit tenir intégralement en mémoire pour être exploité efficacement ; s'il ne rentre pas, l'appareil doit puiser dans le stockage, avec une chute de performance immédiate. La bande passante, elle, conditionne la fluidité de la génération : plus le contexte de la conversation s'allonge, plus il faut relire de données à chaque mot produit, ce qui rend une mémoire lente particulièrement pénalisante sur le long terme.
Cette hiérarchie repose entièrement sur l'architecture à mémoire unifiée d'Apple, où processeur, puce graphique et moteur neuronal puisent dans un seul et même bloc de mémoire, sans duplication des données. Sur un PC classique, la mémoire vive du système et la mémoire vidéo de la carte graphique restent deux réserves séparées, cette dernière étant généralement bien plus limitée en capacité. Le compromis d'Apple penche donc du côté de la capacité plutôt que de la vitesse brute, un choix cohérent avec des modèles volumineux mais qui laisse un écart de bande passante face aux mémoires dédiées des cartes graphiques haut de gamme.
Reste que ce tableau demeure une grille de dimensionnement, pas une garantie. Un test antérieur mené sur iPhone 18 Pro avait permis de faire fonctionner un modèle à 27 milliards de paramètres actifs, soit près du double du seuil recommandé par Apple : le modèle démarrait bien, mais grâce à une quantification très agressive à 1 bit par paramètre, qui réduit fortement sa précision et n'a rien à voir avec les conditions d'usage courantes. Cela confirme que les chiffres du tableau correspondent à un usage fiable et non à une limite technique absolue. Apple n'a par ailleurs précisé ni les modèles testés pour établir cette échelle, ni le niveau de quantification appliqué pour chaque palier, une variable qui influe pourtant fortement sur l'empreinte mémoire réelle d'un modèle.
L’iPhone 18 Pro peut faire tourner un modèle d'IA de 27 milliards de paramètres sans la moindre difficulté
Ce document, pensé pour aider les administrateurs IT à dimensionner leur parc face à l'essor de l'IA locale, donne malgré tout un repère concret et inédit pour qui s'intéresse aux capacités réelles de ses appareils. Il rappelle surtout que, sur cette question, la mémoire unifiée est devenue le véritable indicateur à surveiller avant la fiche technique du processeur.













