Legal AI Intelligence

Welche Modelle können juristisch arbeiten?

Ein fortlaufender Vergleich von KI-Modellen in echter agentischer Rechtsrecherche und klausurartigem juristischem Denken. Gemessen werden Qualität, Zuverlässigkeit und Laufzeit statt bloßer Sprachgewandtheit.

Arbeitsrecht Agent Eval 92/100 GLM-5.3 · 10 von 10 Fällen
BenGER Grundprinzipien 82,6/100 LegalGenius · n=363
Zuletzt aktualisiert: 1. September 2026 2 Benchmarks 42 vollständige Läufe und Referenzsysteme

Was hier anders ist

Nicht nur das Modell, sondern das ganze Arbeitssystem zählt.

Juristische Agenten müssen recherchieren, Quellen lesen, nach Werkzeugaufrufen weiterdenken und eine belastbare Antwort fertigstellen. Deshalb veröffentlichen wir neben dem Qualitätsscore auch die Erfolgsquote und die Laufzeit.

Ergebnisse sind nur innerhalb desselben Benchmarks direkt vergleichbar. Ältere Harness-Versionen bleiben als historischer Kontext sichtbar, werden aber klar markiert.

LegalGenius Praxistest

Arbeitsrecht Agent Eval

Zehn anspruchsvolle Fälle mit Recherche in Gesetzen, Rechtsprechung und Literatur. Jeder Fall wird von einem unabhängigen Judge mit 0 bis 10 Punkten bewertet.

Aufgaben
10
Maximum
100
Agentenlimit
50 Schritte
Bester Score 92 GLM-5.3
Schnell über 85 Punkte 30,5 s GLM-5.2 · Ø je Fall
27B-Modell-Spitze 91 Qwen3.8 27B · Thinking xhigh
Wichtig

Muse Glimmer 30B streute in Wiederholungen zwischen 38 und 87 Punkten. Sein Einzelwert ist deshalb nicht als stabiler Produktionswert zu lesen.

Anbieter-Abdeckung

Geschlossene Modelle im selben Arbeitsrecht-Test

Pro Anbieter zeigen wir den besten bisher gemessenen vollständigen 10-Fälle-Lauf. Fehlende Werte sind bewusst als offen markiert.

Anthropic 92/100 Claude Opus 4.8 · OpenRouter
OpenAI 89/100 GPT-5.5 · OpenRouter
Mistral AI 61/100 Mistral Medium 3.5 · OpenRouter
Moonshot AI Offen Kimi K3 · noch kein vollständiger Lauf
Google Offen Gemini 3.1 Pro · noch kein vollständiger Lauf
xAI Offen Grok 4.6 · noch kein vollständiger Lauf

Offene Gewichte wie GLM, Qwen und DeepSeek stehen bereits in der normalen Modelltabelle. Diese Übersicht ergänzt nur Anbieter mit proprietären Modellgewichten; OpenRouter und Nebius sind dabei lediglich Inferenzrouten.

Qualität und Geschwindigkeit

Vollständige Läufe der aktuellen Harness-Familie. Weiter oben ist besser, weiter links ist schneller.

Spitzengruppe Weitere Modelle
Arbeitsrecht-Score im Verhältnis zur durchschnittlichen Laufzeit Punktdiagramm für vollständige Modellläufe. Die vertikale Achse zeigt den Score von 40 bis 100. Die horizontale Achse zeigt die durchschnittliche Laufzeit bis 180 Sekunden pro Fall.

Provider-spezifische Reasoning-Einstellungen werden je Lauf ausgewiesen. Einen Kostenvergleich ergänzen wir erst, wenn Listenpreis, Cache und Abrechnungsfaktor über alle Provider einheitlich normalisiert sind.

Ausgewählte Modellläufe

Rang

Externer Benchmark

BenGER Benchathon

Fünfzehn klausurartige Aufgaben mit Experten-Musterlösungen. Die Tabelle kombiniert veröffentlichte BenGER-Referenzwerte mit klar markierten eigenen Replikationen.

Aufgaben
15
Notenskala
0–18
Judge
0–100
LegalGenius Baseline 6,60/18
Über der traditionellen Human-Baseline, unter der geschlossenen Spitzengruppe.

Der im Juli getestete GLM-5.2-Rechercheagent bestand 87 Prozent der Aufgaben. Der Abstand zur Spitze lag vor allem bei Rechtskenntnis, Subsumtionstiefe und Schwerpunktsetzung.

Benchathon Leaderboard

Sortierbar nach drei Bewertungsachsen
Rang Typ Quelle

Transparenz vor Rang

So sollten die Werte gelesen werden.

01

Ein Lauf ist noch keine Naturkonstante.

Der 10-Fälle-Test ist bewusst praxisnah, aber klein. Modell- und Provider-Varianz kann einzelne Plätze verschieben. Besonders auffällige Varianz wird markiert.

02

Agenten sind mehr als Basismodelle.

Prompt, Recherchewerkzeuge, Korpus, Tokenbudget, Wiederholungslogik und Provider beeinflussen das Ergebnis. Die Seite benennt deshalb Modell und Systemkonfiguration.

03

Zuverlässigkeit gehört zum Score.

Eine fachlich starke Antwort hilft nicht, wenn der Lauf abbricht. Fehler werden nicht stillschweigend durch spätere Einzel-Retries ersetzt, sondern als null Punkte und in der Erfolgsquote sichtbar.

04

Benchmarks ersetzen keine Einzelfallprüfung.

Die Werte beschreiben Testleistung. Sie sind weder Rechtsberatung noch ein Versprechen, dass ein System in jedem Rechtsgebiet oder Sachverhalt gleich gut arbeitet.

Methodik und Primärquellen Prompts, Bewertungslogik, Konfidenzintervalle und bekannte Grenzen.