LegalGenius Score

Wie vergleicht man juristische KI sinnvoll?

Eine flüssige Antwort ist noch keine gute juristische Antwort. Wer KI für deutsches Recht beurteilen will, muss Korrektheit, Quellenarbeit, Subsumtion und Zuverlässigkeit getrennt messen.

Warum allgemeine KI-Tests nicht ausreichen

Juristische Arbeit besteht nicht nur darin, einen plausiblen Text zu erzeugen. Eine belastbare Evaluierung muss prüfen, ob das System die richtige Norm findet, Tatbestandsmerkmale sauber anwendet, Gegenargumente erkennt und seine Aussage mit überprüfbaren Quellen verbindet.

Korrektheit

Ist das Ergebnis im konkreten Fall richtig – und nicht nur sprachlich überzeugend?

Subsumtion

Verknüpft das System Norm, Tatbestand und Sachverhalt nachvollziehbar?

Zuverlässigkeit

Bleibt die Antwort vollständig, wenn Recherche, lange Kontexte oder Tool-Aufrufe beteiligt sind?

Was der BenGER-Benchmark misst

BenGER („Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law“) ist ein Benchmark für rechtliches Schlussfolgern im deutschen Recht. Das Paper kombiniert 596 klausurartige Freitext-Fallaufgaben mit 531 kurzen Aufgaben zu juristischen Grundprinzipien und vergleicht zwölf Systeme anhand einer offengelegten Bewertungsmethodik.

Zu den Autor:innen gehören Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas und Matthias Grabmair. Die Projektleitung liegt bei Sebastian Nagl und Matthias Grabmair an der Technischen Universität München (TUM).

Bewertet wird nicht nur ein Ja oder Nein. Ein LLM-Judge beurteilt die Antworten anhand einer Rubrik; die Judge-Ergebnisse wurden zusätzlich mit menschlichen Bewertungen gegengeprüft. Im Paper wird für den Judge eine Korrelation von r=0,76 mit menschlichen Bewertungen berichtet. Das macht den Test nützlich – aber nicht unfehlbar.

  • 531 kurze Aufgaben zu juristischen Grundprinzipien
  • 596 klausurartige Freitext-Fallaufgaben im Datensatz
  • offengelegte Prompts, Rubriken und Vergleichswerte

Warum der LegalGenius Score zwei Tests verbindet

Ein starkes Sprachmodell ist noch kein verlässlicher Rechercheagent. Deshalb bewerten wir jedes Modell in zwei getrennten Situationen und bilden anschließend den gleich gewichteten Mittelwert. So bleibt sichtbar, ob ein Modell juristisch argumentieren und zugleich einen mehrstufigen Rechercheprozess steuern kann.

Test Aufbau Was gemessen wird
Agent (Arbeitsrecht) Zehn Fälle mit LegalGenius als Agent und Zugriff auf Gesetze, Rechtsprechung und Literatur Tool-Nutzung, Quellenwahl, Rechercheplanung und belastbare Endantwort
BenGER Benchathon 15 klausurartige Fälle, die das Sprachmodell ohne Werkzeuge oder zusätzliches Korpus löst Ergebnis, Rechtsgrundlagen, Problemerkennung, Subsumtion und methodischer Aufbau
LegalGenius Score des aktuellen Produktmodells (0–100)
  • GLM-5.3 Flash 72,7

Stand 18. September 2026. Der Wert verbindet zehn Agentenaufgaben mit 15 BenGER-Fällen. Das Leaderboard enthält den vollständigen Modellvergleich.

Im Produktbetrieb setzt LegalGenius derzeit GLM-5.3 Flash ein. Der Wert ist ein standardisierter Vergleich über beide Prüfungen und keine Aussage über jede einzelne Recherche. Die vollständigen Vergleichsläufe, einschließlich anderer Modelle und ihrer Kostenannahmen, stehen im öffentlichen Leaderboard.

Vollständigen Modellvergleich ansehen

Methodik und Grenzen

Für jedes Modell wird jede Aufgabe einmal beantwortet. Die BenGER-Antworten werden mit GPT-5.4-mini anhand der veröffentlichten Rubrik bewertet. Der LegalGenius Score ist deshalb ein transparenter Vergleichslauf, aber keine Garantie für die Richtigkeit einer einzelnen Antwort. Insbesondere 15 Klausurfälle bleiben eine kleine Stichprobe, und automatisierte Benotung enthält trotz validierter Rubrik eine messbare Unsicherheit.

Eine praktische Checkliste für juristische KI

Wer ein System für Kanzlei oder Rechtsabteilung evaluiert, sollte mindestens diese fünf Fragen beantworten:

  1. Gibt es echte, domänenspezifische Aufgaben statt nur allgemeiner Chatfragen?
  2. Werden Korrektheit, Subsumtion, Quellen und Vollständigkeit getrennt bewertet?
  3. Wird die Recherchequalität getrennt von der Sprachqualität bewertet?
  4. Werden leere, abgeschnittene oder erfundene Antworten als Zuverlässigkeitsfehler sichtbar?
  5. Sind Aufgaben, Prompts, Rubrik und Unsicherheiten so dokumentiert, dass andere den Test wiederholen können?

Rechtliche KI selbst mit einer Frage ausprobieren

Ein Benchmark zeigt Aggregate. Für den eigenen Workflow zählt zusätzlich, ob die Recherche eine konkrete erste Quellenlage schneller und kontrollierbarer macht. Neue Nutzer erhalten nach der Kontoerstellung 2 € Startguthaben. Damit können Sie den Rechercheweg ohne Kreditkarte und ohne Abo prüfen. Bitte geben Sie keine personenbezogenen Mandantendaten ein.

Evaluation an konkreten Rechercheaufgaben prüfen

Ein Benchmark wird greifbarer, wenn seine Kriterien auf konkrete Rechercheabläufe übertragen werden. Diese Leitfäden zeigen typische Aufgaben, Quellenanforderungen und Grenzen juristischer KI:

Verantwortlich für die Evaluation

Dr. Sten Rüdiger entwickelt LegalGenius und dokumentiert die veröffentlichten Modellvergleiche. Der LegalGenius Score verbindet zehn agentische Arbeitsrechtsaufgaben mit 15 BenGER-Fällen. Aufgaben, Teilwerte, Vergleichsläufe und Kostenannahmen sind im öffentlichen Leaderboard einsehbar.

Zuletzt aktualisiert: 1. Oktober 2026

Quellen und Methodik