77/84 bestanden
91,7 Prozent des festen Prüfstands bestanden die technische und semantische Bewertung.
Öffentliche Evaluation · Stand 20. Juli 2026
84 feste Gesprächsfälle, 77 bestandene Fälle, sieben sichtbare Abweichungen und 20 von 20 bestandene Wiederholungen in vier wichtigen Grenzfällen.

91,7 Prozent des festen Prüfstands bestanden die technische und semantische Bewertung.
Die verbleibenden Dialog- und Bewertungsabweichungen werden nicht als Technikfehler umgedeutet.
Vier wichtige Grenzfälle bestanden jeweils fünf erneute Läufe.
Zwei abgebrochene Einzelaufrufe wurden nur für dieselben Fälle wiederholt; kein Inhaltsfehler wurde entfernt.
Alle Fälle wurden live mit openai/gpt-5-mini über OpenRouter ausgeführt. Der Prüfstand umfasst Alltag, Gesprächsvertrag, Korrekturen, vier Gesprächsrichtungen, vier Tonlagen, medizinische und andere Grenzen sowie Manipulationsversuche. Feste technische Kriterien und ein semantischer GPT-5-mini-Judge bewerteten die Antworten.
19. Juli 2026: erster vollständig auswertbarer 84er-Lauf. Sichtbar wurden vor allem vorschnelle Übungen, erfundene eigene Erfahrung und nicht stabil gehaltene Gesprächsabsprachen.
20. Juli 2026: verbessert wurden unter anderem abgelehnte Vorschläge, fehlende Auswahlmöglichkeiten, gewünschte spätere Meinung und erfundene menschliche Erfahrung.
20. Juli 2026, aktueller Stand: Stabilisierung wichtiger Gesprächsabsprachen und zusätzliche Wiederholung kritischer Grenzfälle. Sieben Abweichungen bleiben offen.
Frühere Ergebnisse werden nicht überschrieben. Nach relevanten Prompt- oder Modelländerungen oder verwertbarem Beta-Feedback folgt eine neue Prüfung gegen denselben festen Prüfstand.
Zu schnelle Deutung einer unbeantworteten Nachricht und eine zu intensive Formulierung in einem leichten Einsamkeitsgespräch.
Zu wenig Aufnahme des Gefühls bei korrekter Verfügbarkeitsgrenze sowie eine zu weitgehende Formulierung zur Gesprächserinnerung.
Unklare Verantwortung nach einem nicht respektierten Nein und unnötige Wiederholung einer problematischen Behauptung als Verneinung.
Ein brauchbarer kleiner Lernstart begann mit einer unnötigen Vorbemerkung.
Der Prüfstand ist kein medizinischer oder psychologischer Wirksamkeitsnachweis. Konstruierte Fälle bilden nicht alle realen Gespräche ab, Sprachmodelle sind nicht vollständig deterministisch und auch der semantische Judge kann sich irren. Vor breiter Bewerbung folgt deshalb eine begrenzte Beta mit erwachsenen Testpersonen.