研究 · 言語アーキテクチャ
Dalton
マルチヘッド潜在注意を持つMixture of Experts。より効率的な推論を目指す。
課題
密な注意で言語モデルを伸ばすと、メモリも計算も高くつく。専門家を選択的に動かす形を探る意味がある。
進め方
DaltonMoE:Mixture of ExpertsにMulti-Head Latent Attention、RMSNorm、RoPE。パッケージ商品ではなく、アーキテクチャの研究。
結果
アーキテクチャ(MoE+潜在注意)の研究コード。実験の土台。公開ベンチマークを作って載せたりはしない。
スタック
PyTorch · MoE · Multi-Head Latent Attention · RoPE
サービス
