本文へ

研究 · 言語アーキテクチャ

Dalton

マルチヘッド潜在注意を持つMixture of Experts。より効率的な推論を目指す。

課題

密な注意で言語モデルを伸ばすと、メモリも計算も高くつく。専門家を選択的に動かす形を探る意味がある。

進め方

DaltonMoE:Mixture of ExpertsにMulti-Head Latent Attention、RMSNorm、RoPE。パッケージ商品ではなく、アーキテクチャの研究。

結果

アーキテクチャ(MoE+潜在注意)の研究コード。実験の土台。公開ベンチマークを作って載せたりはしない。

スタック

PyTorch · MoE · Multi-Head Latent Attention · RoPE

現場で似た話がある?

課題を聞かせてほしい。範囲、フェーズ、投資額をMXNかUSDではっきり組む。その場しのぎの提案はしない。