AccueilActualité742 tokens par seconde, Qwen3.5-9B, IA locale en forte hausse, le Mac...

742 tokens par seconde, Qwen3.5-9B, IA locale en forte hausse, le Mac mini M6 creuse l’écart avec le M4 et surprend les experts

le:

4.9/5 - (40 votes)

Les premiers benchmarks du Mac mini M6 publiés autour de l’IA locale placent la nouvelle machine d’Apple nettement devant le Mac mini M4. Les mesures relayées par MacGeneration font état de gains marqués sur le traitement des prompts, la latence du premier token et la génération d’images. Ces résultats arrivent dans un contexte où les ordinateurs compacts ne sont plus évalués seulement sur le processeur central ou la partie graphique, mais aussi sur leur capacité à exécuter des modèles d’intelligence artificielle sans serveur distant. Pour Apple, l’enjeu dépasse la fiche technique: il s’agit de prouver que son format de bureau le plus accessible peut devenir une station locale crédible pour les usages IA du quotidien.

MacGeneration mesure 742 tokens par seconde sur Qwen3.5-9B

Le chiffre le plus spectaculaire concerne le traitement du prompt. D’après les premiers résultats publiés par MacGeneration, le Mac mini M6 atteint 742 tokens par seconde sur Qwen3.5-9B dans une version quantifiée en 4 bits. Le Mac mini M4, placé dans le même exercice, se limite à 210 tokens par seconde. L’écart représente un gain de 253 %, un ordre de grandeur rarement observé entre deux générations rapprochées sur une tâche aussi précise.

Ce test mesure la vitesse à laquelle la machine lit et prépare la requête envoyée au modèle. Pour un utilisateur, le bénéfice se traduit par une attente réduite lorsque le prompt est long, par exemple pour analyser un document volumineux, résumer plusieurs pages ou injecter un contexte technique détaillé. La génération de la réponse dépend ensuite d’autres paramètres, mais la première phase conditionne fortement la sensation de réactivité.

La progression est moins extrême lors de la production du texte, mais elle reste nette. Le Mac mini M6 atteint 26,9 tokens par seconde, contre 18 tokens par seconde pour le Mac mini M4, soit près de 49 % de mieux. Sur une réponse courte, le gain peut sembler modéré. Sur une conversation prolongée ou un traitement automatisé de dizaines de requêtes, l’écart devient beaucoup plus perceptible.

La quantification en 4 bits joue aussi un rôle important. Elle permet de faire tourner un modèle relativement lourd dans une enveloppe mémoire plus raisonnable, au prix d’une réduction maîtrisée de la précision interne. Le résultat intéresse les développeurs, les étudiants, les journalistes et les petites structures qui veulent tester des assistants locaux sans envoyer leurs données vers une plateforme externe. Le Mac mini M6 apparaît ici comme une machine compacte capable de rendre ces usages plus fluides, sans basculer vers une station de travail coûteuse.

Lire :  3 229 prompts, 242 heures de travail, les coulisses d'un film créé par IA révèlent un chantier inattendu, bien moins automatique
Benchmark Qwen sur Mac mini M6 avec mesures de tokens
Les tests sur Qwen3.5-9B mesurent un fort gain lors du traitement des prompts. — Photo : Markus Winkler / Pexels

Le M6 réduit le premier token à 0,72 seconde

La latence du premier token constitue un indicateur central pour l’usage réel d’un assistant IA. Selon les mesures effectuées avec llama-bench, le Mac mini M6 descend à 0,72 seconde avant le début de la réponse, quand le Mac mini M4 demande 2,5 secondes. L’écart ne concerne pas seulement un score de laboratoire: il modifie la perception immédiate de l’ordinateur, car l’utilisateur obtient un retour presque instantané après validation de sa requête.

Cette baisse de latence compte dans les usages interactifs. Un développeur qui interroge un modèle local sur un extrait de code, un créateur qui teste plusieurs variantes de description ou un chercheur qui enchaîne les demandes bibliographiques ressent directement ce délai initial. Quand la machine répond en moins d’une seconde, l’IA ressemble davantage à un outil intégré au poste de travail qu’à un service lancé en arrière-plan.

La mémoire joue un rôle dans cette évolution. La mémoire unifiée du Mac mini M6 progresse à 153 Go/s sur les configurations de base et monte jusqu’à 170 Go/s avec 32 Go de mémoire unifiée, contre 120 Go/s pour le M4. Les modèles d’IA locaux sollicitent fortement cette bande passante, car les calculs impliquent de déplacer rapidement de grands volumes de paramètres entre les unités de traitement.

Apple bénéficie ici de son architecture intégrée, qui évite de séparer strictement mémoire processeur et mémoire graphique. Cette approche ne remplace pas les cartes graphiques spécialisées haut de gamme, mais elle améliore la cohérence d’un mini-ordinateur silencieux et peu encombrant. Pour les charges d’inférence locales, le M6 semble mieux équilibré que son prédécesseur: plus de débit, moins d’attente initiale et une mémoire plus rapide. Les tests complets devront préciser le comportement lors de sessions longues, notamment quand plusieurs applications lourdes restent ouvertes en parallèle.

Génération d’images FLUX sur Mac mini M6 en studio créatif
La génération d’images locale profite aussi des accélérateurs IA du M6. — Photo : Tranmautritam / Pexels

FLUX.1 passe sous les 36 secondes sur Mac mini M6

Les gains annoncés ne se limitent pas au texte. Sur la génération d’images, MacGeneration indique que FLUX.1 termine un rendu en 36 secondes sur Mac mini M6, là où le Mac mini M4 demande plus d’une minute et demie. La réduction du temps nécessaire atteint 61,7 %, ce qui place la machine dans une catégorie plus confortable pour l’expérimentation créative locale.

Lire :  Quels sont les motifs valables pour une rupture conventionnelle ?

Dans ce type de tâche, le temps d’attente conditionne directement la méthode de travail. Un graphiste, un illustrateur ou un responsable marketing qui teste dix variantes d’une image ne raisonne pas de la même manière si chaque rendu prend 90 secondes ou un peu plus d’une demi-minute. Le raccourcissement du cycle favorise les itérations rapides, les corrections successives et les essais de styles, sans dépendre d’un service en ligne facturé à la génération.

Les observations de WIRED complètent ce tableau avec Draw Things. Le média indique qu’un Mac mini M6 équipé de 16 Go de mémoire a généré une image en 20 étapes avec Flux.2 en une minute et 40 secondes en moyenne, entièrement en local. Cette donnée reste distincte du test FLUX.1, mais elle confirme que le format compact d’Apple peut exécuter des modèles visuels de plusieurs milliards de paramètres dans des conditions réalistes.

La prudence reste nécessaire, car la génération d’images dépend de nombreux réglages: résolution, nombre d’étapes, échantillonneur, modèle choisi, mémoire disponible et optimisation du logiciel. Une comparaison brute ne suffit pas toujours à départager deux machines. Le signal envoyé par ces premiers essais demeure important: Draw Things et les outils similaires deviennent plus crédibles sur un Mac mini d’entrée de gamme, en particulier pour les créateurs qui privilégient la confidentialité, la maîtrise des coûts et la disponibilité immédiate de leur environnement de travail.

Frandroid et WIRED replacent le M6 face aux mini-PC

Les tests généralistes replacent ces performances IA dans un cadre plus large. Frandroid indique que le Mac mini M6 atteint 5 472 points en multicœur et 802 points en monocœur dans Cinebench 2026. Le média situe la puce entre certaines architectures Qualcomm X2 et X2 Extreme, tout en la plaçant encore derrière le M5 Pro. Cette hiérarchie rappelle que le Mac mini M6 vise un équilibre entre compacité, prix et efficacité, plutôt qu’une domination absolue sur toutes les catégories.

Frandroid souligne aussi l’évolution de la partie graphique, composée de 12 cœurs, chacun doté de son accélérateur neuronal pour les charges IA. Le Neural Engine reçoit une évolution majeure avec deux moteurs neuronaux à 16 cœurs. Cette organisation explique une partie des progrès relevés dans les tâches locales, car les calculs d’inférence ne reposent plus uniquement sur le processeur central ou sur le GPU classique.

Lire :  Envoi de SMS pour les sites de Caravaning : une technique pour se différencier de la concurrence

De son côté, WIRED décrit le M6 comme une première vitrine de la nouvelle génération Apple Silicon, avec une gravure en 2 nm et 46 milliards de transistors. Le média évoque une densité accrue d’environ 35 %, donnée importante pour comprendre la hausse de performance sans augmenter fortement l’encombrement. La puce compte aussi deux cœurs CPU de plus que le M4, pour un total de 12, avec des gains annoncés de 21 % en mono-thread et 36 % en multi-thread dans ses mesures.

Face aux mini-PC sous puces AMD ou Intel, le tableau devient plus nuancé. Certains tests synthétiques avantagent Apple, tandis que des rendus spécifiques peuvent rester favorables à des processeurs concurrents. Cette diversité de résultats invite à regarder les usages réels plutôt qu’un seul score. Pour un acheteur intéressé par l’IA locale, le Mac mini M6 présente surtout un ensemble cohérent: une latence réduite, une bande passante mémoire accrue, des accélérateurs spécialisés et un format de bureau discret. Les prochains essais indépendants devront préciser la tenue thermique, le bruit et les performances avec 16 Go face aux configurations mieux dotées.

Questions fréquentes

Pourquoi le score de 742 tokens par seconde est-il important ?
Ce chiffre mesure la vitesse de traitement du prompt avant la réponse du modèle. Plus il est élevé, plus la machine absorbe rapidement un contexte long, comme un document technique ou une demande détaillée. Sur Qwen3.5-9B en 4 bits, le Mac mini M6 dépasse nettement le M4 dans cette phase.
Le Mac mini M6 remplace-t-il une station IA dédiée ?
Non, il ne remplace pas les stations équipées de GPU spécialisés pour les très grands modèles. Il devient en revanche plus crédible pour l’inférence locale, les assistants personnels, les tests de modèles quantifiés et la génération d’images occasionnelle ou semi-professionnelle.
La configuration 16 Go suffit-elle pour l’IA locale ?
Elle peut suffire pour des modèles quantifiés et des usages raisonnables, comme le montrent certains essais avec des modèles de plusieurs milliards de paramètres. Les configurations avec davantage de mémoire restent préférables pour multiplier les applications ouvertes, augmenter la taille des modèles ou travailler avec des images plus lourdes.
michel souris
michel souris
Michel Souris assure une veille permanente sur l'actualité afin d'identifier les sujets qui méritent d'être portés à la connaissance du public. Il rédige des articles sur des domaines variés, avec le souci de rendre l'information claire, pertinente et agréable à lire. Pour l'accompagner dans ses recherches documentaires et l'organisation de ses contenus, il s'appuie sur l'intelligence artificielle, tandis que chaque publication fait l'objet d'un contrôle humain, d'une relecture attentive et d'une validation éditoriale avant sa mise en ligne.

Trouver des backlinks puissants

Trouver des backlink

Top Articles

Articles connexes

2460, deuxième rapport, IA et culture québécoise, ce que Radio-Canada révèle sur la visibilité des œuvres locales

Radio-Canada consacre un nouveau segment à la place grandissante de l'intelligence artificielle dans la culture, un sujet devenu...

2026-2027, 10e édition, IA au centre du Guide Cybersécurité, ce que les entreprises doivent affronter face aux attaques IA

Le Guide Cybersécurité 2026-2027 de Solutions-Numeriques atteint sa 10e édition et place l'intelligence artificielle au premier plan. Ce...

Près de 5% de recul industriel, index salarial attendu à l’été 2027, ce que le Statec révèle sur l’énergie chère au Luxembourg

La hausse brutale des carburants et du mazout relance les interrogations sur l'indexation automatique des salaires au Luxembourg....

5,5 millions de bénéficiaires, aide grands rouleurs prolongée, pêcheurs et infirmiers ciblés, ce qui change pour les travailleurs

Face à des prix à la pompe toujours élevés, le gouvernement resserre sa réponse autour d'aides ciblées pour...