Aller au contenu

Recherche · architectures de langage

Dalton

Architecture Mixture of Experts avec attention latente multi-têtes, tournée vers une inférence plus efficace.

Problème

Faire grandir des modèles de langage avec une attention dense devient cher en mémoire et en calcul. Il vaut la peine d’explorer des architectures qui activent des experts de façon sélective.

Approche

DaltonMoE : Mixture of Experts combiné à Multi-Head Latent Attention, RMSNorm et RoPE — de la recherche d’architecture, pas un produit empaqueté.

Résultat

Code de recherche de l’architecture (MoE + attention latente). C’est une base expérimentale ; on ne reporte pas de benchmarks publics inventés.

Stack

PyTorch · MoE · Multi-Head Latent Attention · RoPE

Quelque chose de similaire chez vous ?

Racontez-nous le problème. On pose le périmètre, les phases et l’investissement en MXN ou USD — pas de proposition improvisée.