Die Möglichkeiten zur Gesundheitsbeurteilung von GPT-5.5 Instant sind sprunghaft angestiegen und die Beurteilungen der Ärzte übertreffen die ihrer menschlichen Kollegen
GPT-5.5 Instant erreicht in den Benchmarks HealthBench und HealthBench Professional Spitzenleistungen und liefert in doppelblinden Ärztebewertungen bessere Antworten als menschliche Ärzte.
OpenAI kündigt GPT-5.5 Instant an, einen großen Durchbruch bei der Gesundheitsbewertung. Das Modell erreicht sowohl bei den HealthBench- als auch bei den HealthBench Professional-Benchmarks Spitzenleistungen. Noch bemerkenswerter ist, dass in von Ärzten durchgeführten Doppelblindbewertungen festgestellt wurde, dass die Antworten von GPT-5.5 Instant besser waren als die von menschlichen Ärzten.
HealthBench deckt die Bewertung grundlegender Kenntnisse in mehreren medizinischen Bereichen ab, einschließlich allgemeiner Abteilungen wie Innere Medizin, Pädiatrie und Chirurgie. HealthBench Professional konzentriert sich auf professionellere medizinische Teilbereiche und testet die Fähigkeiten des Modells bei der Erstellung spezieller Diagnose- und Behandlungsplanempfehlungen.
Laut OpenAI ist diese Verbesserung auf das tiefgreifende Lernen medizinischer Fachliteratur und klinischer Richtlinien während des GPT-5.5-Schulungsprozesses zurückzuführen. Modelle sind nicht nur in der Lage, medizinische Fragen zu beantworten, sondern gewährleisten auch die Konsistenz bei komplexen klinischen Argumentationsaufgaben.
Diese Funktion wurde in ChatGPT integriert und ermöglicht Benutzern den Zugriff auf gesundheitsbezogene Informationen in Gesprächen. OpenAI betont jedoch, dass es sich immer noch um ein Hilfsmittel und nicht um ein medizinisches Gerät handelt und nicht als Ersatz für professionelle medizinische Beratung verwendet werden sollte.
Medizinische KI ist ein wichtiger vertikaler Bereich, um den große Modellhersteller konkurrieren. Die „übermenschliche“ Leistung von GPT-5.5 Instant bei doppelblinden Bewertungen durch Ärzte ist ein Meilenstein in der Branche – dies ist das erste Mal, dass ein allgemeines Konversationsmodell diese Schwelle bei Fragen und Antworten zu klinischem Wissen überschreitet. Für den inländischen medizinischen KI-Bereich ist dies sowohl ein Aufholziel als auch eine Warnung: Die tiefgreifenden Fähigkeiten allgemeiner großer Modelle in Berufsfeldern durchbrechen schnell die Vorteilsbereiche krankheitsspezifischer Modelle.
Bewertungen