Microsoft US 2026/0178987 : Distribuer les Couches MoE sur Puces Spécialisées
Blog
🔬 Innovation Trends9 min de lecture

Microsoft US 2026/0178987 : Distribuer les Couches MoE sur Puces Spécialisées

💡 Microsoft (US 2026/0178987 A1) vient de publier un brevet qui empêche les clusters d'IA de gaspiller la moitié de leurs puces sur des tâches inadaptées. Déposé le 19 février 2026 et publié le 25 juin 2026, il achemine les couches des modèles Mixture-of-Experts (MoE) vers deux classes matérielles spécialisées : des accélérateurs riches en mémoire pour les couches d'experts creuses, et des accélérateurs à fort débit de calcul pour les couches Transformer denses. À l'échelle d'Azure -- faisant tourner GPT-5.2 et Microsoft 365 Copilot -- cette approche paraît susceptible de générer des centaines de millions de dollars d'économies annuelles.

Dépôts de brevets en architecture de puces d'inférence IA (mondial)
2025335
2023~220
2021~110
201711
2017 et 2025 confirmés (PatSnap, 2026) ; 2021 et 2023 estimés à partir de la tendance de croissance 30x en huit ans confirmée.

Ce que le brevet propose réellement

La revendication centrale du brevet US 2026/0178987 A1 est d'une élégance trompeuse : un système informatique qui tient à jour un catalogue des accélérateurs de son cluster, indiquant lesquels sont optimisés pour le calcul matriciel intensif et lesquels disposent d'une grande capacité mémoire, puis achemine les deux familles de couches d'un modèle Mixture-of-Experts vers le groupe matériel le mieux adapté.

Les couches denses -- mécanismes d'attention, normalisation et réseaux de propagation avant, qui traitent des opérations en virgule flottante sur chaque token d'entrée -- partent vers les puces à fort débit de calcul, même si leur mémoire embarquée est plus limitée. Les couches d'experts creuses -- les réseaux d'experts proprement dits, de grandes tables de poids neuronaux dont seuls 2 à 4 experts s'activent par pas d'inférence -- sont acheminées vers des puces disposant d'une mémoire abondante, même si la vitesse de calcul brute est plus faible.

Le mécanisme clé : les accélérateurs orientés mémoire sont configurés pour recevoir simultanément des entrées de plusieurs accélérateurs orientés calcul. Les puces des couches denses terminent leur travail et transfèrent en parallèle les représentations vectorielles des tokens vers plusieurs puces d'experts, de sorte qu'aucune puce n'attend en aval. C'est cette parallélisation qui représente le gain d'efficacité réel. Le système prend aussi en charge la redistribution dynamique : dès qu'une organisation plus efficace est détectée, des experts peuvent migrer d'une puce à l'autre sans redémarrer le modèle.

Le problème à résoudre : la crise des puces inactives à l'ère du MoE

L'architecture Mixture-of-Experts n'est plus une curiosité académique. Elle sous-tend désormais la quasi-totalité des grands modèles d'IA de pointe : elle multiplie le nombre apparent de paramètres tout en n'activant qu'un sous-ensemble de poids par pas d'inférence, maintenant le coût d'exploitation à un niveau raisonnable sans sacrifier les capacités. Les modèles de type GPT, DeepSeek V3 et le Mixtral de Mistral reposent tous sur ce principe.

La difficulté vient de ce que les deux types de couches d'un modèle MoE ont des besoins matériels presque opposés. Les couches denses exigent un débit de calcul en virgule flottante élevé. Les couches d'experts nécessitent de la capacité mémoire pour stocker leurs grandes tables de poids, même si seulement 2 à 4 experts s'activent par token. Lorsque les deux cohabitent sur le même GPU, un décalage émerge : soit le chip manque de mémoire pour accueillir tous les poids d'experts, soit la précieuse puissance de calcul reste oisive pendant que les couches creuses effectuent leurs consultations mémoire.

À l'échelle du cloud -- où Microsoft héberge GPT-5.2 pour OpenAI et fait tourner Microsoft 365 Copilot via Azure -- le gaspillage est bien réel, chiffré en argent à chaque seconde.

La solution à deux types de matériel : la bonne puce pour le bon travail

La réponse du brevet consiste à briser l'hypothèse du cluster homogène. Plutôt qu'un rack de GPU identiques partageant la même charge dense et creuse, le système classe explicitement chaque type de puce et construit le plan de distribution autour de cette différence.

Dans les schémas du brevet, certains GPU traitent les couches denses -- ils portent le squelette du Transformer. D'autres stockent les tables de poids d'experts. Lorsqu'un GPU de couche dense achève le calcul d'attention pour un lot de tokens, il transfère simultanément les représentations vectorielles de ces tokens vers plusieurs GPU experts. Chaque GPU expert peut recevoir des entrées de plus d'un GPU dense à la fois -- des entrées entrelacées traitées en parallèle. Aucune puce n'attend.

Le brevet couvre aussi la redistribution dynamique : si le système détecte qu'un accélérateur est congestionné, il peut migrer un ou plusieurs réseaux d'experts vers une autre puce en cours d'exécution, sans interruption du modèle. Le cluster devient ainsi auto-adaptatif, et non simplement partitionné de façon statique.

Ce dont ce brevet dépend et ce qu'il pourrait débloquer

Ce brevet n'a de valeur que si l'écosystème matériel offre réellement des types de puces significativement différenciés à grande échelle. C'est aujourd'hui le cas : puces à haute bande passante mémoire, accélérateurs d'inférence dédiés, et la puce Maia 200 de Microsoft -- construite sur le procédé 3 nanomètres de TSMC, avec plus de 140 milliards de transistors et plus de 10 pétaFLOPS en précision 4 bits -- représentent le côté calcul dense. Des accélérateurs à mémoire étendue et des dispositifs CXL complètent le côté creux.

Si ce système entre en production, il pourrait débloquer une gamme d'avantages. Les clusters pourraient associer des puces mémoire abordables à des puces de calcul premium coûteuses, réduisant le coût par token. Les modèles pourraient évoluer vers plus d'experts sans acheter de GPU supplémentaires. La redistribution dynamique permet au cluster de s'adapter aux variations de demande sans reconfiguration manuelle.

Ce dernier point rejoint une tendance plus large : l'ère de l'infrastructure IA hétérogène. La période où chaque nœud d'un cluster était identique touche à sa fin. Le brevet US 2026/0178987 A1 constitue une première formulation de la couche logicielle qui fait d'une flotte hétérogène de puces un système IA cohérent.

La position de Microsoft et qui subit la pression

Les inventeurs -- Devangkumar Rameshbhai Patel, Wei Zuo et Yuan Yu, tous domiciliés dans la région de la baie de San Francisco -- ont déposé la demande initiale (US 17/848,679) en juin 2022. Cette continuité signifie que Microsoft développe cette approche depuis quatre ans, en suivant l'idée au fil de la transition des modèles MoE de la recherche vers la production.

La continuation déposée le 19 février 2026 étend la famille de brevets au cycle matériel actuel, au moment même où Maia 200 entre en déploiement Azure et où la puce d'inférence Jalapeño d'OpenAI (annoncée en juin 2026 avec Broadcom) fait son apparition. Microsoft ne se contente pas d'attendre que l'écosystème converge -- il dépose activement les brevets de l'infrastructure logicielle qui relie le matériel, maîtrisant ainsi la couche d'orchestration.

Ce brevet constitue un défi discret pour NVIDIA. L'écosystème NVLink et NVSwitch de NVIDIA suppose un cluster homogène : tous des H100, tous des B200. Si les acheteurs d'infrastructure cloud d'entreprise commencent à préférer des clusters hétérogènes gérés par des logiciels tels que ceux décrits dans ce brevet, la demande de clusters GPU premium homogènes s'atténuera à la marge. Les fournisseurs de solutions à mémoire optimisée en bénéficient directement.

Vision systémique : où ce brevet s'inscrit dans la boucle d'innovation

one systemnot five silosAISemiconductorsGreen energyBatteries6G / IoTBiotech

L'innovation représentée par ce brevet se situe précisément à l'intersection de deux grands noeuds du système technologique actuel : l'intelligence artificielle et la conception de semi-conducteurs. L'architecture MoE a généré un nouveau signal de demande matérielle -- donnez-moi plus de mémoire, mais je n'ai pas toujours besoin de la puissance de calcul -- et ce signal remodèle désormais la façon dont les clusters de puces sont assemblés et programmés. Le brevet traduit cette demande architecturale en une primitive de routage logiciel.

Ce signal se répercute sur la conception de puces : à mesure que l'ordonnancement hétérogène devient courant, les architectes concevront explicitement pour ce double rôle -- des dies orientés mémoire et des dies orientés calcul, conditionnés pour un déploiement mixte. Le concept zHBM de Samsung et l'architecture mémoire XBM d'Intel sont tous deux des réponses à cette même pression fondamentale. La co-évolution logiciel-matériel s'accélère et les dépôts de brevets en constituent l'indicateur avancé : 11 en 2017, environ 335 en 2025, soit une multiplication par 30 en huit ans (PatSnap, 2026).

Tableau récapitulatif du brevet

ChampDétail
Numéro de publicationUS 2026/0178987 A1
Titre officielSystems and Methods for Distributing Layers of Special Mixture-of-Experts Machine Learning Models
DéposantMicrosoft Technology Licensing, LLC (Redmond, WA, États-Unis)
InventeursDevangkumar Rameshbhai Patel ; Wei Zuo ; Yuan Yu
Numéro de demande19/544,617
Date de dépôt19 février 2026
Date de publication25 juin 2026
Brevet parentUS 12,579,470 (déposé le 24 juin 2022)
JuridictionÉtats-Unis (USPTO)
StatutEn cours d'examen (demande publiée)

Qu'est-ce que cela signifie concrètement ?

Pour les bâtisseurs d'infrastructures IA, c'est une feuille de route vers une inférence MoE moins coûteuse. Si cette approche entre en production -- ce que le déploiement de Maia 200 laisse entendre --, elle abaissera la barrière d'accès aux plus grands modèles de pointe sans exiger des racks de GPU premium identiques.

Pour l'industrie technologique dans son ensemble, c'est un signal supplémentaire que l'ère post-GPU ne se résumera pas à une puce de prochaine génération remplaçant l'offre de NVIDIA -- elle repose sur un logiciel permettant à une flotte hétérogène de puces spécialisées de se comporter comme un système unifié. Les entreprises qui déposent tôt la propriété intellectuelle couvrant cette couche logicielle disposeront d'un levier considérable sur le marché de l'infrastructure IA pour la prochaine décennie.

Note de prudence : il s'agit d'une demande publiée, pas encore d'un brevet accordé. Elle peut encore être refusée, réduite ou contestée. Le brevet parent (US 12,579,470) est accordé et constitue un socle -- mais l'étendue exacte des revendications de cette continuation déterminera sa portée commerciale réelle.

FAQ

Qu'est-ce qu'un modèle Mixture-of-Experts (MoE) ?

Un modèle Mixture-of-Experts divise son réseau en de nombreux sous-réseaux spécialisés appelés experts. Pour chaque entrée, une fonction de routage ne sélectionne que 2 à 4 experts à activer, laissant les autres en veille. Cela permet au modèle d'afficher un très grand nombre total de paramètres tout en maintenant un coût de calcul par token faible. La plupart des grands modèles d'IA actuels utilisent une forme quelconque d'architecture MoE.

Pourquoi un seul GPU ne peut-il pas exécuter l'ensemble d'un modèle MoE ?

Les poids des experts d'un grand modèle MoE peuvent atteindre des centaines de gigaoctets. Les GPU actuels plafonnent à 80-192 Go de HBM. Même si le modèle tient en mémoire, les couches d'attention (denses) et les couches de consultation d'experts (creuses) nécessitent des propriétés matérielles opposées : calcul rapide ou grande mémoire. Un seul chip sera toujours mal adapté à la moitié du modèle.

Quelle est la différence avec le parallélisme de modèle existant ?

Le parallélisme de modèle standard (parallélisme tensoriel ou de pipeline) répartit un modèle homogène sur des GPU identiques. Le brevet de Microsoft va plus loin en reconnaissant que les couches MoE ne sont pas homogènes -- elles comportent une moitié dense et une moitié creuse -- et en assignant chaque moitié à une classe matérielle dédiée. Aucun type de matériel ne reste ainsi oisif à traiter une charge de travail pour laquelle il n'est pas adapté.

Quel est le rôle de la traduction de brevets ici ?

Les demandes de brevet comme US 2026/0178987 A1 décrivent des inventions dans un langage juridique et technique très spécialisé. Pour déposer, faire valoir ou concéder sous licence ces brevets dans d'autres juridictions, chaque revendication doit être traduite avec précision. Une erreur de traduction sur la capacité mémoire ou les accélérateurs distribués peut annuler la protection dans ce pays. La mise en oeuvre d'une traduction de brevets et d'une traduction technique professionnelles vers le vietnamien est essentielle pour les entreprises cherchant une protection IP ou des revenus de licence sur les marchés d'Asie du Sud-Est.

Comment la puce Maia 200 de Microsoft est-elle liée à ce brevet ?

Maia 200 est la puce d'inférence IA sur mesure de Microsoft, construite sur le procédé 3 nm de TSMC, avec plus de 140 milliards de transistors et plus de 10 pétaFLOPS en précision 4 bits. Elle est déployée dans Azure pour soutenir GPT-5.2. Le brevet US 2026/0178987 décrit la couche logicielle d'orchestration déterminant comment Maia 200 et d'autres puces collaborent dans un cluster hétérogène, ce qui explique la complémentarité naturelle des deux développements.

Sources : Brevet US 2026/0178987 A1, USPTO (2026) | Patentlyze : brevet Microsoft sur la distribution des couches IA (2026) | Blog Microsoft : Maia 200, janvier 2026 | PatSnap : Paysage de brevets puces d'inférence IA 2026

À propos de l'auteur

Dao Huy (Lucas) est un traducteur technique et de brevets professionnel (anglais, chinois, français vers le vietnamien) avec plus de sept ans d'expérience dans les secteurs de la propriété intellectuelle, du logiciel et de l'ingénierie. Alors que les brevets sur le matériel IA deviennent centraux dans la stratégie concurrentielle -- couvrant les architectures de puces, les systèmes d'inférence distribués et les procédés semiconducteurs -- une traduction technique précise n'est plus une formalité : une revendication mal traduite peut annuler la protection dans une juridiction entière. C'est pourquoi ce travail est essentiel.

Si votre organisation a besoin de traduction de brevets, de traduction technique ou de localisation technologique vers le vietnamien -- qu'il s'agisse d'un seul document de spécifications ou d'un portefeuille IP complet -- Dao Huy propose des services spécialisés pour les documents d'ingénierie, les brevets semiconducteurs et la localisation logicielle. Obtenez un devis gratuit sur daohuy.com.

Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →

DevisWhatsApp