Saltar al contenido

Investigación · arquitecturas de lenguaje

Dalton

Arquitectura Mixture of Experts con atención latente multi-cabeza, orientada a inferencia más eficiente.

Problema

Escalar modelos de lenguaje con atención densa se vuelve caro en memoria y cómputo. Hace falta explorar arquitecturas que activen expertos de forma selectiva.

Enfoque

Implementación de DaltonMoE: Mixture of Experts combinado con Multi-Head Latent Attention, RMSNorm y RoPE — investigación de arquitectura, no un producto empaquetado.

Resultado

Código de investigación de la arquitectura (MoE + atención latente). Sirve como base experimental; no reportamos benchmarks públicos inventados.

Stack

PyTorch · MoE · Multi-Head Latent Attention · RoPE

¿Algo similar en tu operación?

Cuéntanos el problema. Armamos alcance, fases e inversión en MXN o USD — sin propuesta improvisada.