Arena Kostenlos

-

Arena (ehemals LMArena / LMSYS Chatbot Arena) ist eine von der Community betriebene KI-Bewertungsplattform, die vom Forschungsteam der UC Berkeley ins Leben gerufen wurde. Durch den Battle-Modus und den Community-Voting-Mechanismus können Benutzer die Ausgabequalität verschiedener Modelle in realen Szenarien vergleichen und so ein öffentliches Ranking erstellen, das auf über 82 Millionen echten menschlichen Vorlieben basiert. Es deckt multimodale Bewertungsdimensionen wie Text, Code, Bilder und Videoagenten ab und bietet auch kommerzielle Bewertungsdienste für Unternehmen und Modelllabore an.

Arena Produktoberfläche

Arena

Kernparameter und Statistiken von Arena

Arena (ehemals LMArena / LMSYS Chatbot Arena) ist eine von der Community betriebene KI-Bewertungsplattform, die vom Forschungsteam der UC Berkeley gegründet wurde. Es wird offiziell als „von der Community betriebene Plattform zum Verständnis der KI-Leistung in der realen Welt“ positioniert. Es handelt sich weder um einen KI-Dialogassistenten noch um ein Modelltrainings-Framework, sondern um eine Bewertungsinfrastruktur, die „Modellproduzenten“ und „Modellkonsumenten“ verbindet – durch mehr als 82 Millionen echte menschliche Stimmen bildet es ein öffentliches Ranking, das multimodale Dimensionen wie Text, Code, Bilder und Videoagenten abdeckt.

Projekte Öffentliche Informationen
Offizielle Positionierung Von der Community betriebene KI-Bewertungsplattform
Vorgänger LMSYS Chatbot Arena → LMArena (2025) → Arena (2026)
Bewertungsdimensionen Text, Code (WebDev/Image-to-WebDev), Bildgenerierung/-bearbeitung, Videogenerierung/-bearbeitung Vision, Dokument, Suche, Agent
Gemeinschaftsgröße 10 Millionen + monatlich aktive Besucher 700 Millionen + Gespräche 82 Millionen + Stimmen
Geschäftsmodell Kostenloser Community Tier + Enterprise Evaluation Service (KI-Bewertungen)
Finanzierungssituation 100 Mio. $ Seed (2025.05) → 150 Mio. $ Serie A (2026.01)
Annualisierter Umsatz 100 Mio. USD ARR (Stand 2026.06, Unternehmensdienste sind seit 8 Monaten online)
Ort der Zugehörigkeit USA (Berkeley, Kalifornien)
Support-Plattform Web

Ein kurzer Kommentar: Arena ist im Wesentlichen ein „KI-Modell-Bewertungsfeld“ – es erlaubt den Benutzern nicht, Modelle auszuwählen und zu chatten, aber durch den Kampfmodus und die Community-Abstimmung ändert es „Welches Modell ist besser“ von einem subjektiven Eindruck in einen quantifizierbaren Community-Konsens.

Kernmechanismus: Nachdem der Benutzer das Aufforderungswort eingegeben hat, zeigt das System anonym die Ausgabe der beiden Modelle an und der Benutzer stimmt auf der Grundlage seines eigenen Urteils für die bessere Antwort ab. Abstimmungsergebnisse beeinflussen öffentliche Rankings, während Open-Source-Datensätze für die akademische und industrielle Forschung verfügbar sind. Durch diesen Mechanismus entsprechen die Bewertungsergebnisse eher den tatsächlichen menschlichen Präferenzen als den überangepassten Indikatoren statischer Benchmarks.

Umsatzstruktur: Arena wird im Juni 2026 einen Jahresumsatz von 100 Millionen US-Dollar erzielen, nur 8 Monate nach der Einführung des Unternehmensbewertungsdienstes. Das Wachstum resultiert in erster Linie aus den maßgeschneiderten Bewertungsdiensten und der Auswahlunterstützung von Model Lab für Unternehmenskunden – die Serie A im Wert von 150 Millionen US-Dollar wurde gemeinsam von Felicis und UC Investments geleitet, mit Beteiligung von a16z, Kleiner Perkins, Lightspeed und anderen.

Arena-Benutzer und Marktbekanntheit

Die Marktbekanntheit von Arena beruht auf zwei klaren Wegen: dem Datenskaleneffekt auf der Community-Seite und der kommerziellen Verifizierung auf der Unternehmensseite.

Datendichte auf Community-Seite: Nach offiziellen Angaben hat die Plattform insgesamt 700 Millionen + 82 Millionen Konversationen + 10 Millionen + monatlich aktive Besucher. Die Bedeutung dieser Zahlen liegt nicht im Verkehr selbst, sondern im Mangel an „menschlichen Präferenzdaten“ – die überwiegende Mehrheit der Modellüberprüfungen basiert auf statischen Benchmarks oder LLM-als-Richter, während Arena die Beurteilung realer Benutzer zu offenen Aufgaben beibehält. Arena hat den größten menschlichen Präferenzdatensatz zu HuggingFace (lmarena-ai) als Open-Source-Lösung bereitgestellt, der von mehreren Modellierungslabors und akademischen Institutionen zitiert wird.

Wachstumskurve auf Unternehmensseite: Der Unternehmensbewertungsdienst erreichte acht Monate nach seiner Einführung einen ARR von 100 Millionen US-Dollar, was darauf hindeutet, dass Modelllabore und große Unternehmen einen starken Bedarf an „unabhängiger, transparenter Bewertung auf der Grundlage echten menschlichen Feedbacks“ haben. Mehr als 400 neue Modelle wurden von Arena öffentlich evaluiert und umfassen sowohl Open-Source- als auch Closed-Source-Modelle. Der Agent-Modus hat innerhalb eines Monats nach seiner Einführung mehr als 5 Millionen monatliche Interaktionsrunden erreicht, mit einer wöchentlichen Steigerung von 10 %, was beweist, dass die mehrstufige Agentenbewertung eine der dringendsten Lücken auf dem aktuellen Markt darstellt.

Akademischer Einfluss: Das Arena-Team hat auf Top-Konferenzen wie ICML 2024 (Chatbot Arena Paper), NeurIPS 2023 (LLM-as-a-judge), ICLR 2025 (RouteLLM), ICML 2025 (Prompt-to-Leaderboard, Arena-Hard) Papiere zur Bewertungsmethodik veröffentlicht und seine Ranking-Methode ist zu einem der De-facto-Standards in der Community geworden.

Voraussetzungen: Die Glaubwürdigkeit der Bewertungsplattform basiert auf der Vielfalt der Abstimmungsstichproben, der Neutralität der Stichworte und der statistischen Genauigkeit der Ranking-Methode. Plattformbenutzer sind hauptsächlich Techniker (die X/Discord-Community ist aktiv), und die Stichprobenverzerrung kann auf bestimmte Nutzungsszenarien ausgerichtet sein. Dies ist ein Faktor, der bei der Interpretation der Rankings berücksichtigt werden muss.

Arenas Kostenvorteil

  • C-Seite/Individuell: Normalerweise wird eine kostenlose Version bereitgestellt, um die Kernfunktionen zu erleben, und für die hochfrequente Nutzung ist ein kostenpflichtiges Paketabonnement erforderlich.
  • API/Entwickler: Abrechnung nach Anrufvolumen, geeignet für Entwicklungsteams, die flexibel in ihre eigenen Systeme integriert werden können.
  • Unternehmen/privatisiert: Kontaktieren Sie den Geschäftsinhaber für ein individuelles Angebot und einen Bereitstellungsplan. Der konkrete Preis unterliegt der offiziellen Echtzeit-Preisseite.

Hauptmerkmale von Arena

Die Leistungsfähigkeit von Arena ist nicht „eine Chatbox plus Rangliste“, sondern ein umfassendes System, das auf „Bewertung-Routing-Ranking-Daten-Feedback“ basiert:

  • Kampfmodus (anonymer Modellvergleich): Der Benutzer gibt ein Aufforderungswort ein, zwei anonyme Modelle geben es gleichzeitig aus und der Benutzer stimmt über die bessere Antwort ab. Dies ist der zentrale Datenerfassungsmechanismus von Arena. Das wichtigste Design ist Anonymität, um Markenvoreingenommenheit zu beseitigen, zufällige Paarung, um Ranking-Rauschen zu reduzieren, und das ELO-Bewertungssystem sorgt für stabile Rankings über die Zeit. Versteckte Verknüpfung: Jede Abstimmung generiert drei Werte gleichzeitig – Aktualisierung der Rankings, Training des Max-Routing-Modells und Erweiterung des Open-Source-Datensatzes. Es erledigt die drei Aufgaben Datenerfassung, Routing-Optimierung und Community-Beitrag in einem Vorgang.

  • Mehrdimensionales Ranking-System: Nicht nur ein „Gesamtranking“, sondern unterteilt in über 13 unterteilte Rankings nach Fähigkeiten und Modi: Gesamt, Agent, Text, WebDev, Bild-zu-WebDev, Text-zu-Bild, Bildbearbeitung, Text-zu-Video, Bild-zu-Video, Videobearbeitung, Vision, Dokument, Suche usw. Expertenansicht: Der Wert der Segmentierungsliste besteht darin, Verwirrung zu vermeiden – ein Modell mit einem hohen Gesamtrang kann möglicherweise funktionieren mittelmäßig in WebDev-Szenarien. Die Segmentierungsliste ändert die Auswahl von „Auswahl des besten Modells“ zu „Auswahl des Modells, das für diese Aufgabe am besten geeignet ist“.

  • Max Model Router: Eine intelligente Routing-Engine, die auf den über 5 Millionen Abstimmungsdaten der Community basiert und Benutzertipps automatisch an das am besten geeignete Modell verteilt. Technische Implikationen: Max ist im Wesentlichen ein „Modellempfehlungssystem“, das auf dem Training menschlicher Präferenzen basiert. Durch seine Existenz ist Arena nicht nur eine Bewertungsplattform, sondern wird nach und nach auch zur Entscheidungsebene der Modellplanung.

  • Agent-Modus (Mehrstufige Aufgabenbewertung): Ein neuer Bewertungsmodus, der im Juni 2026 eingeführt wurde und die objektive Aufgabenerledigungsrate und Halluzinationsrate für Agentenszenarien misst. Im Gegensatz zu herkömmlichen statischen Benchmarks bewertet der Agent-Modus die Fähigkeit eines Modells, mehrstufige Inferenzen und Tool-Aufrufe in einem offenen Kontext durchzuführen. Innerhalb eines Monats nach seiner Einführung wurden mehr als 5 Millionen monatliche Interaktionen erreicht, was darauf hindeutet, dass die Marktnachfrage nach Agentenbewertungen die Erwartungen bei weitem übersteigt.

  • Unternehmensbewertungsdienste (KI-Bewertungen): Bereitstellung maßgeschneiderter Bewertungen für Modelllabore und Unternehmen, die die Überprüfung von Modellen vor der Veröffentlichung, den Vergleich von Wettbewerbsprodukten und eine detaillierte Fähigkeitsanalyse umfassen. Kernwert: Interne Bewertungsteams stehen häufig vor dem Problem unzureichender Stichprobengröße und fester Bewertungsdimensionen. Der Enterprise-Service von Arena löst diese beiden Engpässe durch den Zugriff auf einen echten menschlichen Abstimmungspool.

Modell- und Versionsentwicklung von Arena

Arena ist nicht das KI-Modell selbst, daher spiegelt sich seine Versionsentwicklung in der kontinuierlichen Erweiterung der Plattformfähigkeitsebene wider:

  • 2025.09 Einführung des Unternehmensbewertungsdienstes: Offizieller Eintritt in die Kommerzialisierungsphase von einem reinen Gemeinschaftsprojekt, Einführung des maßgeschneiderten Bewertungsdienstes AI Evaluations.
  • 2025.11 Arena Expert: Der Bewertungsmodus auf Expertenebene wird eingeführt, die Bewertungsmethodik und der Ranking-Algorithmus werden systematisch verbessert und die Rangliste reagiert empfindlicher auf kleine Unterschiede zwischen Modellen.
  • 2026.01 Marken-Upgrade + Serie A: LMArena wird in Arena umbenannt und positioniert sich von einer „Chatbot-Arena“ zu einer breiteren KI-Bewertungsplattform. Abschluss einer Serie-A-Finanzierung in Höhe von 150 Millionen US-Dollar im gleichen Zeitraum.
  • 2026.02 Max Model Router: Veröffentlichung einer intelligenten Routing-Engine, die auf der Grundlage von mehr als 5 Millionen Community-Stimmen trainiert wurde und den Übergang der Arena-Funktionen von „passiver Evaluierung“ zu „aktiver Planung“ markiert.
  • Multimodale Erweiterung 2026.05: Unterteilungsrankings für die Fullstack Code Arena (WebDev, Image-to-WebDev usw.) hinzugefügt, Multimodal Max veröffentlicht, um multimodales Modellrouting zu unterstützen.
  • Agent-Modus 2026.06: Online-Agentenbewertungsfunktion, die die Bewertung offener mehrstufiger Aufgaben unterstützt und direkt auf den dringenden Bedarf der Branche an der Bewertung der Agentenzuverlässigkeit reagiert.
  • 2026.07 Factual Accuracy Ranking: Factuality Leaderboard hinzugefügt, das zusätzlich zu den menschlichen Präferenzen die Dimension der objektiven sachlichen Korrektheit einführt, als Reaktion auf das seit langem bestehende Problem der „Schwierigkeit bei der Halluzinationsbewertung“ in KI-Modellen.

Hauptlinie der Evolution : Ausgehend von der „Bewertung des Textdialogs“ deckt es sukzessive Dimensionen wie Code, Bilder, Videoagenten und Praktikabilität ab und erstreckt sich von der „reinen Bewertung“ bis zur Geschäftsbeziehung „Bewertung + Routing + Unternehmensdienste“. Jedes Versionsupdate löst in der Branche einen Punkt der Besorgnis hinsichtlich der KI-Bewertung aus.

Die technischen Vorteile von Arena

Der technische Wert von Arena liegt nicht in der Leistung eines einzelnen Modells, sondern in der Designtiefe des Evaluierungs-Engineering-Systems und dem Skaleneffekt des Datenschwungrads:

Statistische Strenge des ELO-Rankingsystems: Arena verwendet ein verbessertes ELO-Bewertungssystem, um Ranking-Verzerrungen durch anonyme Paarung, zufällige Reihenfolge und ausreichende Stichproben zu reduzieren. Das Papier zur Ranking-Methodik wurde von ICML einem Peer-Review unterzogen und ist statistisch gesehen zuverlässiger als eine einfache Gewinnrate oder Durchschnittsbewertung. Kausalkette: Strenge Ranking-Methodik → Glaubwürdigere Rankings → Die Community ist eher bereit, an Abstimmungen teilzunehmen → Mehr Daten → Genauere Rankings.

Der Mangel an umfangreichen menschlichen Präferenzdaten: Über 700 Millionen Gespräche und über 82 Millionen Stimmen bilden einen der größten offenen Datensätze über menschliche Präferenzen weltweit. Der Wert dieser Daten liegt in „offenen Aufgaben + echten Benutzern + mehrdimensionalen Präferenzen“, was sich vom möglichen Überanpassungsrisiko statischer Benchmarks (wie MMLU, GSM8K) unterscheidet. Der Open-Source-Datensatz von HuggingFace ist für mehrere Modelllabore zu einer Hilfsmittel-Ressource für die Evaluierung geworden.

Konstruktive Wiederverwendung der Max-Routing-Engine: Das Empfehlungsmodell von Max ist im Wesentlichen ein Nebenprodukt von Community-Abstimmungsdaten – derselbe Datenstrom dient sowohl der Aktualisierung des Rankings als auch dem Training des Routing-Modells. Dies bildet eine positive Rückkopplungsschleife von „mehr Stimmen → genaueres Routing → bessere Benutzererfahrung → mehr Benutzer stimmen ab“. Aus Kostengründen sind die marginalen Schulungskosten für Routing-Funktionen äußerst niedrig, da die Schulungsdaten jederzeit von kostenlosen Benutzern generiert werden.

Einheitliche Architektur für multimodale Bewertung: Verschiedene Modalitäten wie Text, Code, Bild und Video-Agent nutzen das gleiche Grundgerüst aus „anonymem Vergleich + menschlicher Abstimmung + ELO-Ranking“, was den technischen Aufwand für das Hinzufügen neuer Bewertungsdimensionen reduziert. Die Besonderheit des Agentenmodus ist die Einführung einer objektiven Messung der Abschlussquote, die zusätzlich zu den subjektiven Präferenzen eine quantifizierbare Aufgabenerfolgsquote hinzufügt. Diese Designidee bietet eine Referenz für die spätere Standardisierung der Bewertung.

Technische Einschränkungen: Der Hauptengpass des Bewertungssystems ist nicht die technische Implementierung, sondern die Steuerung der gegnerischen Manipulation – wie man verhindert, dass das Modelllabor Rankings durch gezielte Optimierung spezifischer Aufforderungswörter manipuliert, wie man Vote-Brushing erkennt und wie man die Neutralität und Aktualität des Aufforderungsvokabulars aufrechterhält. Diese Probleme werden mit zunehmender Größe der Gemeinden immer wichtiger.

So verwenden Sie Arena

Der Zugriff auf Arena erfolgt hauptsächlich über das Internet und bietet mehrere Zugänge, um den Anforderungen verschiedener Rollen gerecht zu werden:

So verwenden Sie Geeignet für die Menge Operationspfad Typische Schritte
Kampfmodus Alle Benutzer arena.ai-Homepage → Aufgabentyp auswählen → Eingabeaufforderungswort eingeben → Anonyme Ausgabe vergleichen → Abstimmen Führen Sie einen Modellvergleich innerhalb von 1 Minute durch
Direktes Gespräch Benutzer, die ein bestimmtes Modell benötigen arena.ai → Direktmodus → Modell auswählen → Unterhaltung starten Entspricht einem Chat-Client mit mehreren Modellen
Sehen Sie sich die Rangliste an Technische Entscheider arena.ai/leaderboard → Dimensionen auswählen (Gesamt/Agent/Code usw.) Ohne Registrierung ansehen
Max. Routing Benutzer, die automatisch die beste Antwort erhalten möchten arena.ai → Max-Modus → Geben Sie das Eingabeaufforderungswort ein Das System wählt automatisch das am besten geeignete Modell aus
Agentenmodus Mehrstufige Aufgaben auswerten arena.ai/agent → Aufgabenziele definieren → Modellausführungsprozess beobachten Unterstützung der Auswertung offener langer Aufgaben

Schnellstart für Führungskräfte: Wenn technische Entscheidungsträger bewerten, ob Arena als Bewertungstool verwendet werden kann, sind nur drei Schritte erforderlich: ① Besuchen Sie arena.ai/leaderboard, um zu sehen, ob die Struktur der segmentierten Rankings die für Sie wichtigen Fähigkeitsdimensionen abdeckt; ② Verwenden Sie Ihre eigenen geschäftlichen Aufforderungswörter (anstelle allgemeiner Aufforderungswörter), um 10 bis 20 Mal im Kampfmodus zu vergleichen, um festzustellen, ob der Unterschied in den Ergebnissen mit der tatsächlichen Erfahrung übereinstimmt. ③ Kontaktieren Sie Evaluations@arena.ai, um mehr über den Anpassungsumfang und das Datenisolationsschema der Unternehmensbewertung zu erfahren.

Datenverbrauchspfad: Forscher und Analyseteams für Wettbewerbsprodukte können den Open-Source-Datensatz (lmarena-ai) direkt auf HuggingFace herunterladen, der vollständige anonyme Abstimmungsdatensätze und Modellausgaben für Sekundäranalysen und benutzerdefinierte Ranking-Berechnungen enthält.

Arena-Produktpreise

Das Preismodell unterliegt der offiziellen Echtzeitseite. Normalerweise wird ein Freemium- oder Abonnementsystem übernommen. Grundfunktionen können kostenlos genutzt werden, für erweiterte Funktionen oder eine hochfrequente Nutzung sind kostenpflichtige Abonnements erforderlich. Es wird empfohlen, dass Benutzer die optimale Lösung anhand der tatsächlichen Nutzung bewerten.

Arena-Anwendungsszenarien

Die Evaluierungsinfrastrukturfunktionen von Arena können in eine Vielzahl von Entscheidungsverbindungen eingebettet werden:

  • Modellauswahl und Beschaffungsentscheidung: Vor dem Kauf oder Zugriff auf KI-Modelle können Unternehmen die Kandidaten mithilfe von Arena-Rankings und benutzerdefinierten Vergleichen schnell eingrenzen. Implementierungstipp: Der Wert segmentierter Rankings ist größer als der Gesamtrankings – wenn das Hauptszenario beispielsweise die Front-End-Codegenerierung ist, sollten Sie sich auf die WebDev- und Image-to-WebDev-Rankings statt auf das Gesamtranking konzentrieren. Es wird empfohlen, Arena zunächst für ein vorläufiges Screening zu nutzen und dann mithilfe von Kandidatenmodellen kleine A/B-Tests an Ihren eigenen Geschäftsdaten durchzuführen, um die endgültige Entscheidung zu treffen.

  • Iterative Verifizierung im Model Lab: Das Modellentwicklungsteam holt vor der Veröffentlichung über den Unternehmensbewertungsservice von Arena unabhängige, menschliche Präferenzbewertungen von Dritten ein, um die Wirkung von Versionsverbesserungen zu überprüfen. Kostenreduzierung und Effizienzsteigerung: Herkömmliche Modelle müssen vor ihrer Veröffentlichung ein eigenes Bewertungsteam und eine eigene Annotationsplattform aufbauen, und von der Einrichtung bis zur Ausgabe vergehen in der Regel drei bis sechs Monate. Mithilfe von Arena-Unternehmensbewertungen kann dieser Zyklus auf zwei bis vier Wochen verkürzt werden, und die Kosten für Bewertungen werden von Hunderttausenden Dollar auf die im Vertrag vereinbarte Jahresgebühr gesenkt.

  • Zuverlässigkeitsbewertung von Agenten und mehrstufigen Aufgaben: Mit der explosionsartigen Zunahme von Agent-Produkten kann die herkömmliche Einzelrundenbewertung mehrstufige Argumentations- und Toolaufrufszenarien nicht mehr abdecken. Der Agent-Modus von Arena bietet offene Aufgabenkontexte, die zur Auswertung objektiver Indikatoren wie der Auftragsabschlussrate von Kundendienstmitarbeitern und der Konstruktionserfolgsrate von Code-Agenten verwendet werden können. Szenario-Schmerzpunkte: Die größte Schwierigkeit bei der Agentenbewertung besteht darin, dass der „Goldstandard“ schwer zu definieren ist – für die gleiche Aufgabe können unterschiedliche Ausführungspfade korrekt sein. Der Arena-Agent-Modus mildert dieses Problem, indem er eine hybride Bewertung aus menschlichem Urteilsvermögen und objektiven Abschlussraten einführt.

  • Bildungs- und Technologieevangelisation: In Unterrichtsszenarien kann der Kampfmodus von Arena die Unterschiede in der Art und Weise, wie verschiedene Modelle dasselbe Aufforderungswort verarbeiten, visuell darstellen und den Schülern helfen, die Grenzen der Fähigkeiten des Modells zu verstehen. Die Community-Größe von über 10,1 Millionen aktiven Besuchern pro Monat spiegelt auch die Durchdringung der Bildungsszene wider.

Anwendbare Personen für Arena

Das mehrschichtige Funktionsdesign von Arena dient vier verschiedenen Rollentypen, wobei jede Schicht unterschiedliche Nutzungstiefen und Vorteile bietet:

  • KI-Produktmanager und technische Entscheidungsträger: Personen, die eine Modellauswahl durchführen müssen. Der Kernwert von Arena besteht darin, unabhängig von Modellherstellern Bewertungsdaten Dritter bereitzustellen. Empfohlener Weg: Verwenden Sie zunächst die Rangliste, um den Kandidatenbereich einzugrenzen (1 Tag), verwenden Sie dann den Battle-Modus, um eine kleine Überprüfung mit Ihren eigenen Szenendaten durchzuführen (3-5 Tage), und wenden Sie sich schließlich für eine eingehende Bewertung an die Unternehmensbewertung (1-2 Wochen). Unpassende Grenze: Wenn Ihre Szene sehr vertikal ist (z. B. medizinische Bilddiagnose, Überprüfung von Rechtsdokumenten), sind die allgemeinen Bewertungsdaten von Arena möglicherweise nicht feinkörnig genug und Sie müssen benutzerdefinierte Bewertungen für Ihre eigenen Datensätze durchführen.

  • Modellentwickler und KI-Forscher: Personen, die den Iterationseffekt von Modellversionen überprüfen müssen. Die Unternehmensbewertungen von Arena ergänzen reale menschliche Präferenzdimensionen, die für interne Bewertungsteams nur schwer abzudecken sind. Open-Source-Datensätze sind auch eine wertvolle Ressource für die Forschung zu Ranking-Methoden, Präferenzausrichtung und Modellbewertungstechniken.

  • Enterprise Procurement and Compliance Team: Die Gruppe von Personen, die einen KI-Anbieter für die Organisation auswählen müssen. Die segmentierten Rankings und die öffentliche Methodik von Arena bieten wiederverwendbare Auswahldemonstrationsmaterialien. Nicht für die Grenze geeignet: Die Daten der Bewertungsplattform stellen keine vollständige Bewertung der Sicherheit des Modells dar – wenn Ihr Szenario sensible Daten oder strenge Compliance-Anforderungen (wie HIPAA, DSGVO) umfasst, sind weiterhin unabhängige Sicherheitsaudits und Compliance-Überprüfungen erforderlich.

  • KI-Enthusiasten und Early Adopters: Erfahren Sie mehr über die Unterschiede in den Funktionen modernster Modelle im Kampfmodus mit kostenlosem Zugriff auf mehrere Modelle. Solche Benutzer tragen auch maßgeblich zu den Abstimmungsdaten der Plattform bei.

Zusammenfassung und Ausblick von Arena

Die zentrale Wettbewerbsfähigkeit von Arena liegt im Zweiradmodell „Community-gesteuertes Datenschwungrad + kommerzieller Bewertungsdienst“ – über 82 Millionen echte menschliche Stimmen stellen eine extrem hohe Datenbarriere dar, und das schnelle Wachstum der Unternehmensbewertungsdienste (100 Mio. USD ARR in 8 Monaten) bestätigt die Monetarisierungsfähigkeit dieses Vermögenswerts auf der kommerziellen Seite. Der Weg der Fähigkeitserweiterung vom Text zum Agenten zu Fakten zeigt, dass sich Arena von einer „Modell-Chat-Arena“ zu einer „umfassenden Bewertungsinfrastruktur für KI-Fähigkeiten“ entwickelt.

Aktuelle Einschränkungen und Unsicherheiten: ① Die Stichprobenverzerrung der Rangliste – aktive Benutzer sind hauptsächlich technische und frühe Anwender und spiegeln möglicherweise nicht die Präferenzen universeller Benutzer wider; ② Das Risiko einer gegnerischen Manipulation – da der kommerzielle Einfluss der Rankings zunimmt, hat das Modelllabor einen Anreiz, die prompten Worte der Rankings zu optimieren, und die Ranking-Methode muss diesen Goodhart-Effekt weiterhin bekämpfen; ③ Die privatisierte Bereitstellungsfähigkeit wird nicht offengelegt – Unternehmen mit hohen Anforderungen an die Datensouveränität müssen bestätigen, ob Arena vollständig isolierte Bewertungskontexte unterstützt; ④ Mehrsprachige Abdeckung – die aktuellen Bewertungsdaten sind hauptsächlich auf Englisch, und die Zuverlässigkeit der Rankings in nicht-englischen Szenarien wie Chinesisch muss überprüft werden.

Beschaffungs-/Einführungsrisikobewertung: Als Referenztool für den Modellvergleich ist Arena äußerst kostengünstig – die kostenlose Stufe deckt bereits die Kernvergleichsfunktionalität ab. Für die Beschaffung auf Unternehmensebene wird jedoch empfohlen, in drei Schritten vorzugehen: ① Verwenden Sie zunächst die kostenlose Stufe, um die Konsistenz der Ranking-Daten und der tatsächlichen Erfahrung in 2-3 Kernszenarien (1 Monat) zu überprüfen. ② Wenn detailliertere Evaluierungsfunktionen erforderlich sind, wenden Sie sich an das Evaluierungsteam des Unternehmens, um maßgeschneiderte Lösungen anzufordern und auf Kundenfälle zu verweisen. ③ Bevor Sie einen Vertrag unterzeichnen, konzentrieren Sie sich auf die Bestätigung der Datenisolation, der Ergebniszuordnung und der Exklusivitätsbedingungen und verlangen Sie ein SLA, das die Reaktionszeit der Bewertung und die Datenverfügbarkeitsgarantie abdeckt. Die endgültige Auswahlentscheidung sollte nicht nur auf den Bewertungsdaten von Arena basieren, sondern auch mit den tatsächlichen Messergebnissen der eigenen Geschäftsszenarien und unabhängigen Sicherheitsbewertungen kombiniert werden.

Verwandte Tools: deepseek, chatgpt

So verwenden Sie Arena

  • Web-Client: Sie können ihn nutzen, indem Sie die offizielle Website besuchen und ein Konto registrieren. Die meisten Funktionen erfordern keine Installation.
  • API-Zugriff: Bietet RESTful API, Entwickler können den API-Schlüssel erhalten und ihn in ihre eigenen Anwendungen integrieren.

Versionsinfo

  • Arena-Plattform (Agentenmodus + Factuality-Bestenliste) :Es wurde ein neues Factuality Leaderboard hinzugefügt, die Bewertungsmöglichkeiten im Agentenmodus auf mehr als 5 Millionen monatliche Interaktionsrunden erweitert und die multimodale Bewertungsabdeckung weiter verbessert.
  • Agentenmodus + Fullstack-Code-Arena :Freigegebener Agentenmodus zur Unterstützung der objektiven Abschlussraten- und Halluzinationsratenbewertung von mehrstufigen komplexen Aufgaben; hat die Rangliste der Fullstack Code Arena eingeführt.
  • Neue Kategorien + Multimodal max :Rangfolge der Code Arena-Unterteilungen hinzugefügt (WebDev / Image-to-WebDev usw.); hat die multimodalen Modell-Routing-Funktionen von Multimodal Max veröffentlicht.
  • Max-Modell-Router :Veröffentlichung der Max-Modell-Routing-Engine, die Benutzeraufforderungen basierend auf mehr als 5 Millionen Community-Stimmen automatisch an das am besten geeignete Modell weiterleitet.
  • Umbenennung von LMArena → Arena :LMArena hat seinen Namen offiziell in Arena geändert und damit die Markenaufwertung und Produkterweiterung abgeschlossen. Im gleichen Zeitraum schloss das Unternehmen eine Serie-A-Finanzierung in Höhe von 150 Millionen US-Dollar ab.
  • Arena-Experte :Einführung des Arena Expert-Bewertungsmodus auf Expertenebene und Einführung verfeinerter Bewertungsdimensionen für Domänenfähigkeiten und Aktualisierungen der Ranking-Methodik.
  • Start der Unternehmensevaluierung :Offiziell gestarteter kommerzieller Bewertungsdienst (AI Evaluations), um maßgeschneiderte Modellbewertungen für Unternehmen und Modelllabore bereitzustellen.

Benutzerbewertungen

  • Bewertungen werden geladen...