Recherche · architectures de langage
Dalton
Architecture Mixture of Experts avec attention latente multi-têtes, tournée vers une inférence plus efficace.
Problème
Faire grandir des modèles de langage avec une attention dense devient cher en mémoire et en calcul. Il vaut la peine d’explorer des architectures qui activent des experts de façon sélective.
Approche
DaltonMoE : Mixture of Experts combiné à Multi-Head Latent Attention, RMSNorm et RoPE — de la recherche d’architecture, pas un produit empaqueté.
Résultat
Code de recherche de l’architecture (MoE + attention latente). C’est une base expérimentale ; on ne reporte pas de benchmarks publics inventés.
Stack
PyTorch · MoE · Multi-Head Latent Attention · RoPE
