DeepSeek veröffentlicht V2 Open-Source-Großmodell: die erste MLA-Architektur, 236B MoE mit Fokus auf hohe Kostenleistung

Im Mai 2024 veröffentlichte DeepSeek die DeepSeek-V2-Serie großer Open-Source-Modelle, die erstmals Multi-Head Latent Attention (MLA) und MoE-Sparse-Architektur einführten. Es verfügt über insgesamt 236 Milliarden Parameter und eine einzelne Token-Aktivierung von etwa 21 Milliarden. Es vergleicht Mainstream-Modelle mit extrem niedrigen Inferenzkosten und legt einen effizienten Weg für nachfolgende V3 und R1 fest.

Im Mai 2024 veröffentlichte DeepSeek die -Serie großer Open-Source-Modelle. Als repräsentatives Open-Source-Modell im AI Smart Assistant-Track kombiniert V2 erstmals Multi-Latent Attention (MLA) mit Mixture of Experts (MoE) und wird so zu einem wichtigen technischen Meilenstein in der Entwicklung der DeepSeek-Reihe.

DeepSeek-V2 Open-Source-Großmodell-MLA- und MoE-Architekturübersicht

Bild: Startseite und Dialogeingang der offiziellen DeepSeek-Website. Der V2-Vortrainingskorpus besteht aus etwa 8,1 T-Tokens, wobei YaRN zum Erweitern des Kontexts von 4 KB auf 128 KB und MLA zum Komprimieren des KV-Cache verwendet wird. Nach Angaben der Financial Times beträgt der Preis pro Million ausgegebener Token nur 2 Yuan.

Versionsübersicht

Projekt Inhalt
Urheberrecht: Inhaltquelle DeepSeek-Beamter . Diese Plattform hat den Inhalt für Informationszwecke und Lernaustausch zusammengestellt. Bei Urheberrechtsbedenken kontaktieren Sie uns bitte.

Bewertungen

  • Bewertungen werden geladen...