Korrektheit
Ist das Ergebnis im konkreten Fall richtig – und nicht nur sprachlich überzeugend?
Eine flüssige Antwort ist noch keine gute juristische Antwort. Wer KI für deutsches Recht beurteilen will, muss Korrektheit, Quellenarbeit, Subsumtion und Zuverlässigkeit getrennt messen.
Juristische Arbeit besteht nicht nur darin, einen plausiblen Text zu erzeugen. Eine belastbare Evaluierung muss prüfen, ob das System die richtige Norm findet, Tatbestandsmerkmale sauber anwendet, Gegenargumente erkennt und seine Aussage mit überprüfbaren Quellen verbindet.
Ist das Ergebnis im konkreten Fall richtig – und nicht nur sprachlich überzeugend?
Verknüpft das System Norm, Tatbestand und Sachverhalt nachvollziehbar?
Bleibt die Antwort vollständig, wenn Recherche, lange Kontexte oder Tool-Aufrufe beteiligt sind?
BenGER („Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law“) ist ein Benchmark für rechtliches Schlussfolgern im deutschen Recht. Das Paper kombiniert 596 klausurartige Freitext-Fallaufgaben mit 531 kurzen Aufgaben zu juristischen Grundprinzipien und vergleicht zwölf Systeme anhand einer offengelegten Bewertungsmethodik.
Zu den Autor:innen gehören Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas und Matthias Grabmair. Die Projektleitung liegt bei Sebastian Nagl und Matthias Grabmair an der Technischen Universität München (TUM).
Bewertet wird nicht nur ein Ja oder Nein. Ein LLM-Judge beurteilt die Antworten anhand einer Rubrik; die Judge-Ergebnisse wurden zusätzlich mit menschlichen Bewertungen gegengeprüft. Im Paper wird für den Judge eine Korrelation von r=0,76 mit menschlichen Bewertungen berichtet. Das macht den Test nützlich – aber nicht unfehlbar.
Ein starkes Sprachmodell ist noch kein verlässlicher Rechercheagent. Deshalb bewerten wir jedes Modell in zwei getrennten Situationen und bilden anschließend den gleich gewichteten Mittelwert. So bleibt sichtbar, ob ein Modell juristisch argumentieren und zugleich einen mehrstufigen Rechercheprozess steuern kann.
| Test | Aufbau | Was gemessen wird |
|---|---|---|
| Agent (Arbeitsrecht) | Zehn Fälle mit LegalGenius als Agent und Zugriff auf Gesetze, Rechtsprechung und Literatur | Tool-Nutzung, Quellenwahl, Rechercheplanung und belastbare Endantwort |
| BenGER Benchathon | 15 klausurartige Fälle, die das Sprachmodell ohne Werkzeuge oder zusätzliches Korpus löst | Ergebnis, Rechtsgrundlagen, Problemerkennung, Subsumtion und methodischer Aufbau |
Stand 18. September 2026. Der Wert verbindet zehn Agentenaufgaben mit 15 BenGER-Fällen. Das Leaderboard enthält den vollständigen Modellvergleich.
Im Produktbetrieb setzt LegalGenius derzeit GLM-5.3 Flash ein. Der Wert ist ein standardisierter Vergleich über beide Prüfungen und keine Aussage über jede einzelne Recherche. Die vollständigen Vergleichsläufe, einschließlich anderer Modelle und ihrer Kostenannahmen, stehen im öffentlichen Leaderboard.
Vollständigen Modellvergleich ansehenFür jedes Modell wird jede Aufgabe einmal beantwortet. Die BenGER-Antworten werden mit GPT-5.4-mini anhand der veröffentlichten Rubrik bewertet. Der LegalGenius Score ist deshalb ein transparenter Vergleichslauf, aber keine Garantie für die Richtigkeit einer einzelnen Antwort. Insbesondere 15 Klausurfälle bleiben eine kleine Stichprobe, und automatisierte Benotung enthält trotz validierter Rubrik eine messbare Unsicherheit.
Wer ein System für Kanzlei oder Rechtsabteilung evaluiert, sollte mindestens diese fünf Fragen beantworten:
Ein Benchmark zeigt Aggregate. Für den eigenen Workflow zählt zusätzlich, ob die Recherche eine konkrete erste Quellenlage schneller und kontrollierbarer macht. Neue Nutzer erhalten nach der Kontoerstellung 2 € Startguthaben. Damit können Sie den Rechercheweg ohne Kreditkarte und ohne Abo prüfen. Bitte geben Sie keine personenbezogenen Mandantendaten ein.
Ein Benchmark wird greifbarer, wenn seine Kriterien auf konkrete Rechercheabläufe übertragen werden. Diese Leitfäden zeigen typische Aufgaben, Quellenanforderungen und Grenzen juristischer KI:
Dr. Sten Rüdiger entwickelt LegalGenius und dokumentiert die veröffentlichten Modellvergleiche. Der LegalGenius Score verbindet zehn agentische Arbeitsrechtsaufgaben mit 15 BenGER-Fällen. Aufgaben, Teilwerte, Vergleichsläufe und Kostenannahmen sind im öffentlichen Leaderboard einsehbar.
Zuletzt aktualisiert: 1. Oktober 2026