Gemma Kostenlos

-

Gemma ist eine leichtgewichtige Open-Source-Serie , die von Google DeepMind auf der Grundlage der Gemini-Forschungsergebnisse veröffentlicht wurde. Gemma 2 bietet drei Skalen von 2B/9B/27B, folgt der Apache 2.0-Lizenz und ist für die kommerzielle Nutzung kostenlos. Es ist speziell für endseitige und ressourcenbeschränkte Szenarien optimiert. Es bietet eine führende Leistung im gleichen Parameterbereich und unterstützt HuggingFace, Kaggle und Google Cloud. Mehrkanalzugriff.

Gemma Produktoberfläche

Gemma – Googles leichtgewichtige Open-Source-Modellreihe für große Sprachen

Kernparameter und Statistiken

Parameter Einzelheiten
Neueste Version Gemma 2 (2B/9B/27B)
Erscheinungsdatum 27.06.2024
Lizenz Apache 2.0 (vollständig offen für kommerzielle Nutzung, keine monatliche Aktivitätsbeschränkung)
Kontextfenster 8192 Token (Gemma 2)
Technologiequelle Basierend auf Gemini-Forschungsergebnissen unter Verwendung der Wissensdestillationstechnologie
Veröffentlichungskanäle HuggingFace, Kaggle, Google Cloud Vertex AI
Variantenmodell CodeGemma (Code), PaliGemma (visuelle Sprache), RecurrentGemma
Quantisierungsunterstützung GGUF, GPTQ, AWQ und andere gängige Quantisierungsformate
Inferenzrahmen HuggingFace Transformers, llama.cpp, Ollama, vLLM
Google Colab-Unterstützung Kostenloses Colab-Notizbuch, Gemma direkt im Browser ausführen

Der Hauptunterschied zwischen Gemma und Llama ist die Lizenz: Gemma verwendet Apache 2.0 (keine Beschränkung der Benutzergröße, wirklich vollständig Open Source), während die Meta-Llama-Lizenz von Llama 3 spezielle Lizenzen erfordert, nachdem sie 700 Millionen aktive Benutzer pro Monat überschreitet. Für wachsende kommerzielle Anwendungen bietet die Apache 2.0-Lizenz von Gemma noch mehr sorgenfreien Rechtsschutz.

Benutzer- und Markterkennung

Seit seiner Veröffentlichung im Februar 2024 hat Gemma bei den Downloads auf HuggingFace weiter zugenommen und ist nach der Llama-Serie zur zweitbeliebtesten Open-Source-LLM-Familie geworden. Das leistungsstarke Entwickler-Ökosystem von Google (Kaggle, Colab, Google Cloud) bietet Gemma einen einzigartigen Vertriebskanal. Eine große Anzahl von Datenwissenschaftlern und Teilnehmern des Kaggle-Wettbewerbs haben über eine vertraute Plattform Zugriff auf Gemma und bilden so eine schnell wachsende Benutzerbasis.

Gemma 2 27B erreichte im Blindtest-Ranking der LMSys Chatbot Arena ein Niveau nahe GPT-4 Turbo. Dieses Benchmark-Ergebnis erregte große Aufmerksamkeit in der Open-Source-Community und bewies, dass parametereffiziente kleine Modelle durch Wissensdestillation Leistungsniveaus erreichen können, die weit über der erwarteten Anzahl von Parametern liegen. Die Einführung professioneller Varianten wie CodeGemma und PaliGemma erweitert die Anwendungsszenarienabdeckung des Gemma-Ökosystems weiter.

Kostenvorteil

Methode Preis Wichtigste anwendbare Szenarien Funktionen
Lokale Bereitstellung Hardwarekosten (einmalig) Datenschutzanwendungen, Entwicklungsexperimente Apache 2.0, keine kommerziellen Einschränkungen
Google Cloud Vertex AI Abrechnung per Token (Gemini-Preissystem) Enterprise-API-Integration Tiefe Integration mit Google Cloud
HuggingFace-Inferenz Kostenloser (begrenzter) oder PRO-Plan Leichte App-Tests Schnellster Einstieg, keine lokale GPU erforderlich
Kaggle-Notizbücher Kostenlos (GPU inklusive) Datenwissenschaftliche Experimente Kostenloser Zugang für Kaggle-Benutzer

Die quantisierte Version von Gemma 2 2B kann kaum auf der CPU laufen und läuft reibungslos auf einem MacBook (M-Chip) oder RTX 3060. Es handelt sich um eine der leistungsstärksten Optionen unter den „KI-Modellen, die auf einem Laptop ausgeführt werden können“. Die Hardwareanforderungen des Gemma 2B/9B führen zu deutlich geringeren Entwicklungskosten im Vergleich zu größeren Modellen, die einen A100 erfordern.

Hauptfunktionen

  • Gemma 2-Multiskalen-Vortrainingsmodell (Basis): Bietet ein grundlegendes Vortrainingsmodell ohne Feinabstimmung der Anweisungen, das für Forscher geeignet ist, um sekundäre Feinabstimmungen in bestimmten Aufgaben oder Bereichen durchzuführen. Die drei Skalen 2B/9B/27B decken unterschiedliche Rechenleistungsszenarien ab, vom terminalseitigen Einsatz bis hin zu Hochleistungsservern.
  • Gemma 2 Instruction fein abgestimmte Version (Instruct): Eine Konversationsversion, die mit der Befolgung von Anweisungen und sicherer Ausrichtung trainiert wird. Es kann sofort in Chat-Assistenten und Q&A-Anwendungen verwendet werden. Es kann ohne zusätzliche Feinabstimmung hochwertige Interaktionsmöglichkeiten in natürlicher Sprache erhalten.
  • Ultrahohe Parametereffizienz der Wissensdestillationsoptimierung: Gemma 2 erzielt deutlich führende Benchmark-Testergebnisse im gleichen Parametermaßstab, indem es die Parametereffizienz aus größeren Gemini-Modellen erhält (27B destilliert aus Gemini, 9B/2B destilliert aus 27B). Diese „Destillationsketten“-Strategie ist die zentrale technologische Innovation der Gemma-Serie.
  • CodeGemma (codespezifische Variante): Eine Gemma-Variante, die speziell für die Codevervollständigung, Codegenerierung und mathematische Argumentation optimiert ist. Es bietet zwei Spezifikationen: 2B (Codefüllung) und 7B (Anweisungsversion). Die Leistung von Codeaufgaben ist besser als beim allgemeinen Gemma-Modell desselben Maßstabs.
  • PaliGemma (multimodale Version in visueller Sprache): Eine multimodale Gemma-Variante, die das Bildverständnis unterstützt. Es kann gemischte Eingaben von Bildern und Text verarbeiten, Bildbeschreibungen durchführen, visuelle Fragen beantworten und Aufgaben zum Verstehen von Dokumenten durchführen. Es ist ein Vertreter des leichtgewichtigen multimodalen Open-Source-Modells von Google.
  • Uneingeschränkte kommerzielle Lizenz für Apache 2.0: Alle Gemma-Modelle folgen der Apache 2.0-Lizenz und können in kommerziellen Produkten jeder Größe frei verwendet, geändert und verteilt werden, ohne Einschränkungen hinsichtlich der Anzahl der Benutzer oder des Einkommens. Es handelt sich um eine der liberalsten kommerziellen Open-Source-LLM-Lizenzen.
  • Google Colab-Erlebnis ohne Konfiguration: Google stellt ein offizielles Colab-Notizbuch für Gemma bereit. Benutzer können Gemma ohne lokale GPU direkt im Browser ausführen. Es ist der niedrigste Einstiegspunkt für KI-Lernende und Datenwissenschaftler, um Gemma kennenzulernen.
  • Kaggle Ecological Deep Integration: Gemma ist tief in die Kaggle-Plattform integriert und unterstützt die Teilnahme an Kaggle-Wettbewerben und

Direkte Anrufe in Notebooks und ein einzigartiger Vertriebskanal für die Data-Science-Community bilden eine einzigartige Nische, die Gemma von anderen Open-Source-LLMs unterscheidet.

Modell- und Versionsentwicklung

Version Erscheinungsdatum Beschreibung
Gemma 1.0 (2B/7B) 21.02.2024 Googles erste Gemma-Version, Basisversion + Befehlsversion, Apache 2.0-Lizenz
CodeGemma (2B/7B) 09.04.2024 Codespezifische Varianten, Codefüllung und Generierungsoptimierung
Gemma 1.1 (2B/7B aktualisierte Version) 05.04.2024 Befehle folgen Qualitätsverbesserungen, beheben Dialogprobleme in Version 1.0
RecurrentGemma (2B/9B) 2024-04 Effiziente Inferenzvariante basierend auf linearer rekursiver Architektur, geeignet für Edge-Geräte
PaliGemma (3B multimodal) 2024-05 Visuelles Sprachmodell zur Unterstützung von Bildverständnisaufgaben
Gemma 2 (2B/9B/27B) 27.06.2024 Zweite Generation, Optimierung der Wissensdestillation, stark verbesserte Leistung, 27B liegt nahe an GPT-4 Turbo
Gemma 2 JetBrains/Ollama 2024-08 Mainstream-IDEs und lokale Inferenztools unterstützen Gemma 2 und das Ökosystem wächst weiter

Technische Vorteile

Ultrahohe Parametereffizienz durch die Wissensdestillationskette: Der technische Kern von Gemma 2 ist die mehrstufige Wissensdestillation – 27B wird aus den größeren Gemini destilliert und 9B und 2B werden aus 27B destilliert. Diese Destillationskette ermöglicht es jeder Größe des Gemma 2-Modells, ein Leistungsniveau zu erreichen, das weit über seine Parametergröße hinausgeht. Dies ist der technische Grund, warum Gemma 2 9B Llama 3 70B im HuggingFace Open LLM Leaderboard überholt hat, und spiegelt die führenden Forschungsergebnisse von Google DeepMind im Bereich Modellkomprimierung und Wissenstransfer wider.

Die lockerste kommerzielle Lizenz von Apache 2.0: Im Vergleich zur Meta-Llama-Lizenz von Llama (für über 700 Mio. MAU ist eine besondere Genehmigung erforderlich) unterliegt die Apache 2.0-Lizenz von Gemma keinen Einschränkungen hinsichtlich der kommerziellen Nutzung. Entwickler und Unternehmen können Gemma in kommerzielle Produkte jeder Größenordnung integrieren, ohne sich Gedanken über die Auslösung von Lizenzbeschränkungen machen zu müssen, wenn das Unternehmen wächst. Dadurch werden die rechtlichen Compliance-Risiken von Unternehmen, die Open-Source-LLM verwenden, verringert.

Enge Integration mit der Google-Infrastruktur: Gemma ist ein natives Supportmodell für Google Cloud, Vertex AI, Colab und Kaggle mit optimalem Zugriff und Tool-Unterstützung auf diesen Plattformen. Für Unternehmen, die Google Cloud für ihre Cloud-Infrastruktur eingeführt haben, bietet die Verwendung von Gemma die tiefste Integration mit dem Google-Ökosystem, einschließlich der verwalteten, fein abgestimmten Modellregistrierung und Sicherheitsüberwachungsfunktionen von Vertex AI.

Kleiner, leistungsstarker endseitiger Bereitstellungswert: Gemma 2 2B ist derzeit eines der leistungsstärksten 2B-Parameterskalen-Open-Source-Modelle. Es kann lokal auf einem Android-Telefon mittlerer Konfiguration ausgeführt werden (mit dem Google AI Edge-Framework) und bietet praktische lokale LLM-Funktionen für endseitige KI-Anwendungen (Offline-Sprachassistent, geräteseitige Verarbeitung zum Schutz der Privatsphäre usw.). Es ist ein wichtiger Unterscheidungsvorteil von Gemma im Vergleich zu Lama (mindestens 8B).

Wie zu verwenden

Eingang Beschreibung
HuggingFace Besuchen Sie https://huggingface.co/google/gemma-2-9b, um Zugriff anzufordern und das Modell herunterzuladen
Kaggle Nutzen Sie Gemma kostenlos in Kaggle-Notebooks, inklusive GPU-Beschleunigung
Google Colab Verwenden Sie das offizielle Colab-Notebook von Google, um ohne lokale GPU zu laufen
Ollama (lokal) ollama run gemma2:9b Lokale Bereitstellung mit einem Klick
Vertex-KI Zugriff auf den Gemma-API-Dienst über Google Cloud Vertex AI

Typische Nutzungsschritte (HuggingFace verbunden mit Gemma 2):

  1. Besuchen Sie https://huggingface.co/google/gemma-2-9b, melden Sie sich bei Ihrem HuggingFace-Konto an und akzeptieren Sie die Nutzungsvereinbarung (Apache 2.0, keine zusätzlichen Einschränkungen).
  2. Abhängigkeiten installieren: „pip install Transformers beschleunigen“.
  3. Verwenden Sie HuggingFace Transformers, um das Modell zu laden: „from Transformers Import AutoTokenizer, AutoModelForCausalLM“.
  4. Laden Sie den Tokenizer und das Modell (erfordert mindestens 20 GB Videospeicher, um das 9B-Modell auszuführen, 2B entspricht etwa 6 GB) oder verwenden Sie die quantisierte Version, um den Videospeicherbedarf zu reduzieren.
  5. Schreiben Sie Inferenzcode und verwenden Sie „model.generate()“, um Text zu generieren. Die Gemma-Befehlsversion folgt dem Konversationsformat „user ... “.
  6. Wenn eine Feinabstimmung erforderlich ist, wird empfohlen, HuggingFace TRL + LoRA für eine effiziente Feinabstimmung der Parameter zu verwenden.

Produktpreise

Gemma-Modellgewichte sind völlig kostenlos und die Kosten für die Nutzung jeder Plattform sind unterschiedlich:

  • Modellgewicht-Download: völlig kostenlos, Apache 2.0-Lizenz, keine kommerziellen Einschränkungen, kann direkt von HuggingFace oder Kaggle heruntergeladen werden, keine spezielle Anwendung erforderlich.
  • Lokale Bereitstellung: Nur Hardwarekosten, Gemma 2 2B läuft reibungslos auf RTX 3060 (12 GB), 9B erfordert RTX 3090 (24 GB) oder die Bereitstellung mit mehreren Karten.
  • Kaggle-Notebooks: Das kostenlose Kaggle-Konto bietet ein begrenztes GPU-Kontingent (ca. 30 Stunden/Woche T4-GPU), mit dem Gemma-Experimente ausgeführt und ohne Kosten gestartet werden können.
  • Google Colab: Die kostenlose Version bietet eine begrenzte GPU-Nutzung und Colab Pro (ca. 10 $/Monat) bietet mehr GPU-Ressourcen und ist für mittelgroße Experimente geeignet.
  • Google Cloud Vertex AI: Kommerzielle API-Dienste werden per Token abgerechnet. Konkrete Preise finden Sie auf der offiziellen Preisseite von Google Cloud. Es bietet verwaltete Inferenzdienste für Anwendungen auf Unternehmensebene.

Anwendungsszenarien

  1. KI-Funktionen für Mobilgeräte und Edge-Geräte: Das kompakte Design von Gemma 2 2B ist für den endseitigen Einsatz optimiert. Es kann über das Google AI Edge-Framework lokal auf Android-Geräten der mittleren bis oberen Preisklasse ausgeführt werden. Es unterstützt intelligente Offline-Assistenten, Echtzeit-Textverarbeitung und datenschutzschützende geräteseitige NLP-Funktionen. Es ist die bevorzugte Open-Source-Lösung für mobile Anwendungen, die Offline-KI-Funktionen erfordern.

  2. KI-Bereitstellung mit begrenzten Ressourcen: KI-Anwendungen in eingebetteten Systemen, Edge-Servern und Cloud-Instanzen mit geringer Rechenleistung nutzen das quantisierte Gemma 2B/9B-Modell, um praktische Textgenerierungs- und Fragebeantwortungsfunktionen innerhalb des begrenzten GPU-Speichers (8–16 GB) bereitzustellen. Es ist eine ideale Wahl, um die KI-Funktionen zu maximieren, wenn die Hardwarebedingungen begrenzt sind.

  3. KI-Lernexperiment für Studenten und Forscher: Durch den Zugriff auf Gemma über Kaggle-Notebooks (kostenlose GPU) können Datenwissenschaftsstudenten den gesamten LLM-Feinabstimmungs-, Bewertungs- und Bereitstellungsprozess kostenlos erleben. Die Apache 2.0-Lizenz stellt sicher, dass akademische Forschungsergebnisse frei veröffentlicht und kommerzialisiert werden können, was sie zu einem der barrierefreisten Open-Source-LLMs für die KI-Ausbildung macht.

  4. KI-Integration für Google Cloud-Unternehmen: Unternehmen, die Google Cloud eingeführt haben, nutzen Gemma auf Vertex AI, um von der tiefsten Integration in die Google-Infrastruktur, dem verwalteten Feinabstimmungsdienst Model Registry-Versionsverwaltung und Sicherheits-Compliance-Funktionen auf Unternehmensniveau zu profitieren und die Kostenvorteile von Open-Source-Modellen mit der technischen Zuverlässigkeit von Google Cloud zu kombinieren.

  5. Code-unterstützte Tool-Entwicklung: Verwenden Sie CodeGemma 7B, um privatisierte Code-Vervollständigungs- und Code-Review-Tools zu erstellen, diese lokal oder im Intranet bereitzustellen und die Codeübertragung über Cloud-Dienste wie GitHub Copilot zu vermeiden. Die Apache 2.0-Lizenz stellt sicher, dass Code-Tools frei kommerzialisiert werden können, was für Softwareunternehmen mit Anforderungen an den Schutz geistigen Eigentums geeignet ist.

Anwendbare Personen

  • Datenwissenschaftler und Teilnehmer des Kaggle-Wettbewerbs: Die tiefe Integration der Kaggle-Plattform und der kostenlose GPU-Zugriff machen Gemma zu einer natürlichen Wahl für diese Gruppe und fügen sich nahtlos in bestehende Arbeitsabläufe ein.
  • Mobile und clientseitige KI-Entwickler: Für Android-Entwickler, die LLM auf dem Gerät ausführen müssen, ist die Kombination aus Gemma 2B und Google AI Edge derzeit die ausgereifteste clientseitige LLM-Entwicklungslösung.
  • Unternehmen, die eine Apache 2.0-Lizenz benötigen: Für Unternehmen, die rechtliche Bedenken hinsichtlich der Meta-Llama-Lizenz von Llama haben und eine lockerere Open-Source-Lizenz benötigen, bietet Gemma für Apache 2.0 sorgenfreie Garantien für die kommerzielle Nutzung.
  • Google Cloud-Benutzer: Teams, die eine Google Cloud-Infrastruktur bereitgestellt haben, können Gemma auf Vertex AI verwenden, um das beste Integrationserlebnis und Support auf Unternehmensniveau zu erhalten.
  • Ungeeignete Szenarien: Anwendungen, die eine extrem lange Kontextverarbeitung erfordern (>8K-Token) (Gemma 2-Kontextfenster ist relativ klein, 128K von Llama 3.1 sind besser geeignet); Anwendungen auf Produktionsebene, die höchste Leistung erfordern (Gemma 27B ist stärker als Konkurrenzprodukte der gleichen Größenordnung, aber es gibt immer noch eine Lücke im Vergleich zu Llama 3.1 405B oder GPT-4); Teams, die bereits über einen stabilen Llama-Technologie-Stack verfügen und keine Motivation für eine Migration haben.

Zusammenfassung und Ausblick

Die Gemma-Reihe repräsentiert Googles strategische Ausrichtung im Bereich Open-Source-KI – durch die Veröffentlichung der Top-Forschungsergebnisse von Gemini an die Entwicklergemeinschaft in Form einer offenen Lizenz fördert sie nicht nur die Popularität von KI, sondern lockt auch eine große Anzahl von Entwicklern in das Google-Ökosystem (Cloud, Colab, Kaggle). Die ultrahohe Parametereffizienz, die die Wissensdestillationskette mit sich bringt, ist Gemmas wichtigster technischer Differenzierungspunkt und ermöglicht es kleinen Modellen, eine Leistung zu erzielen, die die erwartete Leistung der Parameterskala übertrifft.

Die Wahl der Apache 2.0-Lizenz spiegelt Googles aufrichtiges Engagement für die Open-Source-Community wider. Sie ist offener als die Lama-Lizenz von Meta und bietet einen einzigartigen Vorteil auf dem Unternehmensmarkt, der auf die Einhaltung gesetzlicher Vorschriften achtet.

Nachfolgender Schwerpunkt: Die Erweiterung der Parameterskala und die Verbesserung der multimodalen Fähigkeiten (visuell, audio) der Gemma 3-Serie, die funktionale Weiterentwicklung des visuellen Sprachmodells von PaliGemma, die Perfektionierung des geräteseitigen Bereitstellungsökosystems von Google AI Edge und seine differenzierte Positionierung mit Gemini Nano (geräteseitige Gemini) werden Gemmas langfristige Position in der Open-Source-LLM-Wettbewerbslandschaft bestimmen.

Verwandte Tools: hugging-face, replicate

Versionsinfo

  • Gemma 2 (2B/9B/27B) :Gemma 2 wird offiziell mit den drei Parametergrößen 2B, 9B und 27B veröffentlicht. Es nutzt die Wissensdestillationstechnologie, um die Fähigkeiten großer Modelle in kleine Modelle zu komprimieren. In Mainstream-Benchmark-Tests wie der LMSys Chatbot Arena liegt Gemma 2 27B nahe am GPT-4 Turbo-Niveau und die 9B-Version übertrifft alle Open-Source-Modelle derselben Größenordnung. Alle Versionen folgen der Apache 2.0-Lizenz und sind für die kommerzielle Nutzung kostenlos; Gleichzeitig werden in HuggingFace, Kaggle und Google Cloud die drei Hauptkanäle gleichzeitig freigegeben, was die Zugriffsschwelle erheblich senkt.
  • Gemma 1.1 (2B/7B aktualisierte Version) :Die aktualisierte Version von Gemma 1.1 wurde veröffentlicht. Besondere Verbesserungen wurden vorgenommen, um die Anweisung aufgrund von Qualitätsproblemen zu beheben, die von Benutzern in Gemma 1.0 gemeldet wurden, und die Dialogfunktionen der Anweisungsversion (Instruct) wurden erheblich verbessert. Gleichzeitig wurden CodeGemma (codespezifische 2B/7B-Version) und RecurrentGemma (Variante für hocheffizientes Denken) offiziell eingeführt und die Gemma-Modellfamilie auf professionelle Szenarien wie die Codegenerierung erweitert.
  • :Google veröffentlichte die Gemma-Open-Source-Modellreihe zum ersten Mal und brachte eine Pre-Training-Version (Base) und eine Anweisungs-Feinabstimmungsversion (Instruct) in zwei Größen auf den Markt: 2B und 7B. Basierend auf der Destillation der Ergebnisse der Gemini-Modellforschung wurden führende Ergebnisse bei Open-Source-Modell-Benchmark-Tests derselben Parameterskala erzielt. Es bietet drei Zugriffskanäle: HuggingFace, Kaggle und Google Colab und veröffentlicht ein Toolkit für die verantwortungsvolle KI-Nutzung.

Benutzerbewertungen

  • Bewertungen werden geladen...