Methode
Wie die möglichen Gespräche für „Innere Abgründe“ rekonstruiert wurden
Prompt Decoding dient in diesem Buch einer menschlichen Frage: Wie lässt sich das Schweigen von Tätern sexualisierter Gewalt in der katholischen Kirche besser verstehen, wenn ihre persönliche Sprache nicht zugänglich ist?
Akten, Studien und Verfahren dokumentieren äußere Vorgänge. Sie können zeigen, was gemeldet, entschieden, unterlassen oder institutionell bearbeitet wurde. Die innere Selbsterzählung eines Menschen bleibt davon getrennt. Prompt Decoding füllt diese Lücke nicht mit Tatsachenbehauptungen. Die Forschungsthese lautet jedoch, dass reale Prompts, Beispiele und menschliche Rückmeldungen vergleichbare Beziehungen zwischen Rolle, Konflikt, Absicht und Sprache im Modellverhalten mitgeprägt haben. Diese Beziehungen bilden den begrenzten Möglichkeitsraum, in dem das Verfahren wiederkehrende Sprachmuster untersucht.
Die Methode dient damit auch der Frage, wie ein großer Widerspruch zwischen moralischem Selbstbild und tatsächlicher Verantwortungsvermeidung sprachlich aufrechterhalten werden kann. Sie beweist nicht, dass dieser Widerspruch bei einer konkreten Person in genau dieser Form besteht.
1 · Grundidee
Was Prompt Decoding in diesem Projekt bedeutet
Ein Sprachmodell lernt statistische Beziehungen zwischen Sprache, Rollen, Situationen, Anliegen und möglichen Gesprächsverläufen. Prompt Decoding nutzt diese Beziehungen in umgekehrter Richtung: Statt nur nach einer Antwort auf eine bekannte Eingabe zu fragen, wird untersucht, welche möglichen Eingaben das Modell mit einem definierten Rollen- und Konfliktraum verbindet.
Für „Innere Abgründe“ wurden keine realen Personenprofile rekonstruiert. Ausgangspunkt waren definierte und modellierte Rollenräume in unterschiedlichen Schuld-, Konflikt- und Verantwortungsvermeidungsszenarien. Der Rollenraum umfasst nur die ausdrücklich gesetzten Merkmale; er steht nicht für katholische Priester insgesamt.
Prompt Decoding liest keine Menschen aus. Es macht statistisch gelernte Rollen-, Kontext- und Sprachbeziehungen untersuchbar.
2 · Eingabe und Ausgabe
Warum Eingabe und Ausgabe zusammengehören
Ein Sprachmodell erzeugt Antworten nicht unabhängig von der Eingabe. Welche sprachliche Fortsetzung wahrscheinlich wird, hängt vom Prompt, vom bisherigen Gesprächskontext, von den formulierten Zielen und von den Rollen- oder Situationsbeschreibungen ab.
Vereinfacht arbeitet das Modell in der üblichen Richtung so:
Eingabe, Rolle und Kontext → Verteilung möglicher Ausgaben
Je genauer eine Situation, Absicht oder Rolle beschrieben wird, desto stärker wird der sprachliche Raum eingegrenzt, innerhalb dessen das Modell seine Antwort erzeugt. Das bedeutet nicht, dass nur ausführliche Eingaben hilfreiche Antworten ermöglichen. Es bedeutet, dass jede spezifische Antwort von einem sprachlichen und situativen Inputraum abhängt.
Was Training, Fine-Tuning und menschliches Feedback verändern
Im Vortraining lernt ein Sprachmodell statistische Beziehungen zwischen Wörtern, Themen, Rollen, Situationen und möglichen Fortsetzungen. Im anschließenden Post-Training wird sein Verhalten gezielter darauf ausgerichtet, Anweisungen zu verstehen, hilfreiche Antworten zu geben und menschlichen Erwartungen besser zu entsprechen.
Beim überwachten Fine-Tuning erhält das Modell zusätzliche Beispiele aus Eingaben und erwünschten Antworten. Dabei werden seine Gewichte angepasst, sodass bestimmte Aufgaben, Formulierungen und Reaktionsweisen künftig zuverlässiger oder wahrscheinlicher erzeugt werden.
Ein weiteres dokumentiertes Verfahren ist Reinforcement Learning from Human Feedback, kurz RLHF. Menschen vergleichen oder bewerten unterschiedliche Modellantworten. Dazu können eigens erhobene Rangfolgen von Antworten ebenso gehören wie freiwillige Nutzersignale, etwa Daumen hoch, Daumen runter oder ergänzende Rückmeldungen zu einer Antwort. Aus solchen Präferenzsignalen können Bewertungsdaten entstehen, mit denen Modelle evaluiert und weiter darauf ausgerichtet werden, hilfreiche, passende und erwünschte Antworten wahrscheinlicher zu erzeugen. RLHF wurde unter anderem in den Forschungsarbeiten zu InstructGPT und zu hilfreichen und möglichst harmlosen KI-Assistenten beschrieben.
Nicht jede einzelne Bewertung verändert das Modell unmittelbar. Die Signale können jedoch gesammelt, ausgewertet und für spätere Evaluationen, Präferenzmodelle oder Trainingsschritte genutzt werden.
Solches Feedback prägt, welche Antwortweisen ein Modell als hilfreich, passend oder erwünscht behandelt. Prompt Decoding untersucht deshalb nicht nur allgemeine Sprachbeziehungen, sondern auch ein Modellverhalten, das durch menschliche Beispiele, Präferenzurteile und Nutzungssignale mitgeformt wurde. Die Forschungsthese des Projekts lautet, dass gerade solche realen Eingaben, Beispiele und Rückmeldungen die Beziehungen zwischen Rolle, Konflikt, Absicht und Sprache im Modellverhalten mitgeprägt haben, die anschließend untersucht werden.
Menschliche Beispiele und Präferenzbewertungen → veränderte Wahrscheinlichkeiten für mögliche Antworten
Solches Post-Training verändert nicht nur einzelne Formulierungen. Es beeinflusst, wie ein Modell auf unterschiedliche Anliegen, Rollen, Gesprächssituationen und erkennbare Absichten reagiert. Ein seelsorgerisches Anliegen, eine Bitte um Entlastung oder eine konflikthafte Selbstbeschreibung führen deshalb nicht unabhängig vom Input zu beliebigen Antworten. Sie aktivieren unterschiedliche, durch Training und Post-Training geprägte sprachliche Reaktionsräume.
Dadurch entsteht kein lesbares Archiv einzelner Gespräche. Aus den Modellgewichten lässt sich kein historischer Originalprompt einfach zurückholen. Im beobachtbaren Modellverhalten werden aber Beziehungen zwischen Eingaben, Rollen, Absichten, Bewertungen und möglichen Antworten erkennbar.
Genau darin liegt die methodische Relevanz für Prompt Decoding: Das Verfahren versucht nicht, gespeicherte Gespräche auszulesen. Es untersucht, welche Inputhypothesen ein trainiertes und auf menschliche Erwartungen ausgerichtetes Modell wiederholt mit einem definierten Rollen-, Konflikt- und Sprachraum verbindet.
Was Prompt Decoding in der Gegenrichtung untersucht
Auf dieser Grundlage kehrt Prompt Decoding die übliche Blickrichtung um und nutzt die nach der Forschungsthese durch reale Prompts, Beispiele und Rückmeldungen mitgeprägten Beziehungen für eine gezielte Hypothesensuche:
Definierter Rollen-, Konflikt- und Ausgaberaum → dazu passende mögliche Eingaben
Dafür werden Rollen, Situationen, Absichten und Konfliktlagen festgelegt. Innerhalb dieses Raums erzeugt und vergleicht das Verfahren mögliche Inputhypothesen. Untersucht wird, welche Arten von Eingaben über unterschiedliche Variationen hinweg mit den gesuchten sprachlichen Bewegungen verbunden bleiben.
Mehrere Eingaben können zu ähnlichen Ausgaben führen. Prompt Decoding rekonstruiert deshalb weder den einen ursprünglichen Prompt noch den mathematisch wahrscheinlichsten Input. Es beschreibt einen modellseitig passenden Inputraum und sucht darin nach wiederkehrenden Mustern.
Für „Innere Abgründe“ lautet die Frage somit nicht: Welcher reale Priester hat diesen Prompt geschrieben? Sondern: Welche möglichen Eingaben verbindet das Modell mit einer definierten Priesterrolle, einer bestimmten Konfliktlage und Sprachmustern von Schuld, Scham, Selbstentlastung oder Verantwortungsvermeidung?
3 · Realer Kontext
Reale Nutzung als Kontext
Der Anthropic Economic Index zeigt, dass große Mengen realer KI-Gespräche datenschutzwahrend analysiert und bestimmten Aufgabenfeldern zugeordnet werden können. Damit hat es angefangen: Die erste Veröffentlichung im Februar 2025 wertete ungefähr eine Million Claude-Konversationen automatisiert aus und verband sie mit Aufgaben des beruflichen Klassifikationssystems O*NET. Seither wird der Index fortlaufend aktualisiert; spätere Auswertungen beruhen auf neueren und voraussichtlich deutlich größeren Datenmengen.
Die Zuordnung beschreibt die Aufgabe im Gespräch. Sie belegt weder den Beruf oder die Identität der schreibenden Person noch, dass jede einzelne Klassifikation zweifelsfrei richtig ist. Auch die Angabe kleiner Prozentwerte ist kein eigenständiger Beleg für die Genauigkeit der Messung.
Die Economic-Index-Auswertung ist zudem nicht mit Modelltraining gleichzusetzen. Ob Nutzerinteraktionen zur Modellverbesserung verwendet werden, hängt von Anbieter, Produkt, Datenschutzeinstellung und Einwilligung ab. Aus dem Economic Index lässt sich nicht ableiten, welche Gespräche für Training oder Fine-Tuning verwendet wurden.
Für Prompt Decoding ist ein solcher Nachweis nicht erforderlich. Das Verfahren setzt nicht voraus, dass ein bestimmter Täterprompt oder ein Gespräch eines realen Priesters im Trainingsmaterial enthalten war. Entscheidend ist, dass Sprachmodelle umfangreiche Beziehungen zwischen Rollen, Aufgaben, Absichten, Situationen und sprachlichen Reaktionen gelernt haben.
4 · Rollen und Kontexte
Rollen, Kontexte und Konfliktlagen
Eine mögliche Eingabe hängt nicht allein von einer Rollenbezeichnung ab. Entscheidend ist die Kombination aus Rolle, Situation, Beziehung, Konflikt und Gesprächsziel. Deshalb wurden Konstellationen systematisch variiert, zum Beispiel:
- unterschiedliche Nähe oder Distanz zum eigenen Fehlverhalten
- Angst vor dem Verlust von Amt, Ansehen, Einkommen oder Zugehörigkeit
- religiöse Selbstdeutung, Scham, Schuld und der Wunsch nach Entlastung
- Anwesenheit oder Abwesenheit institutioneller Stellvertretung
- direkte Konfrontation mit Verantwortung oder Möglichkeiten des Ausweichens
- unterschiedliche sprachliche Formen von Eingeständnis, Relativierung und Verschiebung
Die Variation soll verhindern, dass ein einzelner Ausgangstext fälschlich als typisches Ergebnis behandelt wird.
5 · Rekonstruktion
Rekonstruktion möglicher Eingaben
Das Sprachmodell wurde innerhalb der definierten Konstellationen dazu verwendet, mögliche Eingaben beziehungsweise Anliegen zu rekonstruieren. „Modellseitig passend“ bedeutet: Die Formulierung entspricht nach den gelernten statistischen Beziehungen dem gesetzten Rollen- und Situationsraum.
Das erlaubt keine Aussage darüber, wie häufig reale Menschen entsprechend formulieren oder ob eine bestimmte Person ChatGPT nutzt. Der Erkenntniswert liegt im Vergleich der Formulierungen, die innerhalb des Modells wiederholt zum definierten Rollen- und Situationsraum passen.
6 · Vergleich
Variation, Vergleich und Musterbildung
Einzelne Ausgaben können zufällig, zugespitzt oder unergiebig sein. Ausgewertet wurden deshalb nicht einzelne spektakuläre Sätze, sondern wiederkehrende Bewegungen über unterschiedliche Variationen hinweg.
Verglichen wurde unter anderem:
- worauf die modellierte Rolle ihre Aufmerksamkeit richtet
- ob Betroffene als Gegenüber vorkommen oder sprachlich verschwinden
- wie Verantwortung anerkannt, begrenzt oder verschoben wird
- welche Funktion religiöse Begriffe in der jeweiligen Selbsterzählung erhalten
- welche Verluste, Ängste und Loyalitäten die Sprache strukturieren
- wie persönlicher Selbstschutz und institutionelle Bezugnahmen zusammen auftreten
Aus wiederkehrenden Bewegungen entstanden thematische Muster. Ihre Auswahl, Benennung und Einordnung ist eine redaktionelle Leistung des Autors, keine automatisch erzeugte wissenschaftliche Klassifikation.
7 · Plausibilitätscheck
Ein früherer Plausibilitätscheck des Verfahrens
Prompt Decoding wurde bereits vor diesem Buch eingesetzt, um mögliche Nutzungsmuster von ChatGPT zu rekonstruieren. Eine im Mai 2025 veröffentlichte Analyse beschrieb praktische Unterstützung, Informationssuche und Schreiben als dominante Einsatzbereiche. Daneben rekonstruierte sie kleinere Bereiche wie persönliche Reflexion und Coaching mit rund zwei Prozent sowie Unterhaltung und Rollenspiel.
Im September 2025 veröffentlichten OpenAI und beteiligte Forschende eine groß angelegte Untersuchung tatsächlicher ChatGPT-Nachrichten. Auch dort dominierten praktische Unterstützung, Informationssuche und Schreiben. Der Kategorie „Beziehungen und persönliche Reflexion“ wurden 1,9 Prozent der untersuchten Nachrichten zugeordnet, „Spiele und Rollenspiel“ 0,4 Prozent.
Die Kategorien wurden unabhängig voneinander entwickelt und sind nicht vollständig deckungsgleich. „Coaching“ kann beispielsweise auch praktische Beratung umfassen. Der Vergleich validiert deshalb weder jeden rekonstruierten Prompt noch Prompt Decoding als Methode insgesamt.
Bemerkenswert ist dennoch, dass die frühere modellgestützte Rekonstruktion sowohl die großen Nutzungsschwerpunkte als auch mehrere kleinere Kategorien in ähnlicher Größenordnung erfasste. Das Projekt versteht diese Übereinstimmung als retrospektiven Plausibilitätscheck.
Die Übereinstimmung spricht dafür, dass Prompt Decoding statistisch gelernte Nutzungsmuster in einer bemerkenswert realitätsnahen Struktur sichtbar machen kann.
Die Übereinstimmung beweist nicht, dass die rekonstruierten Tätergespräche tatsächlich geführt wurden oder dass ein konkreter Täter in dieser Weise denkt. Für „Innere Abgründe“ begründet sie jedoch die Untersuchung eines sprachlichen Möglichkeitsraums als nachvollziehbare, begrenzte Hypothese.
8 · Äußerer Rahmen
Der dokumentierte äußere Rahmen
Studien, Gutachten und kirchliche Verfahrensdokumente wurden getrennt von den Rekonstruktionen ausgewertet. Sie dokumentieren unter anderem institutionelle Entscheidungen, Aktenführung, Versetzungen, Sanktionen, Verantwortlichkeiten und die Berücksichtigung Betroffener innerhalb ihres jeweiligen Untersuchungsrahmens.
Die Gegenüberstellung dient der Kontextualisierung. Ein dokumentierter institutioneller Befund beweist nicht, dass ein rekonstruiertes inneres Sprachmuster bei einer konkreten Person vorlag. Umgekehrt ist ein wiederkehrendes Modellmuster kein zusätzlicher empirischer Beleg für einen Vorgang.
Allgemeine Nutzungsdaten belegen keine konkreten Schuld-, Beicht- oder Tätergespräche. Ihr Wert liegt darin, persönliche Reflexion und religiöse Aufgaben als reale Nutzungskontexte der Forschungsfrage zu dokumentieren.
9 · Aussageebenen
Drei getrennte Aussageebenen
Dokumentierter Befund: Was Studien, Gutachten und Dokumente innerhalb ihrer Methode und Reichweite tatsächlich zeigen.
Modellgestützte Rekonstruktion: Welche möglichen Sprachmuster in den definierten Rollen-, Kontext- und Konflikträumen wiederkehren.
Redaktionelle Interpretation: Welche Bedeutung das Buch aus den Mustern und ihrer Gegenüberstellung mit dem dokumentierten Rahmen ableitet.
Keine Ebene erlaubt eine Aussage über die Gedanken einer identifizierten Person. Ihre sprachliche Trennung macht nachvollziehbar, welche Aussage auf welcher Grundlage beruht und wie weit sie reicht.
10 · Leistung
Was die Methode leisten kann
- einen systematisch begrenzten sprachlichen Möglichkeitsraum eröffnen
- wiederkehrende Formen von Selbstentlastung und Verantwortungsverschiebung sichtbar machen
- Unterschiede zwischen Einsicht, Reue, Anerkennung und Verantwortung untersuchbar machen
- Fragen für die redaktionelle Auseinandersetzung mit Schweigen und institutioneller Sprache schärfen
- dokumentierte äußere Strukturen und modellierte innere Sprachbewegungen vergleichend lesbar machen
11 · Grenze
Was die Methode nicht beweist
- keine Wiederherstellung historischer Originalprompts
- kein Zugriff auf private Gespräche oder Trainingsdatensätze
- kein Nachweis, dass ein bestimmter Prompt im Training enthalten war
- keine Identifikation realer Personen
- keine eindeutige Umkehrung von einer Ausgabe auf eine einzige Eingabe
- keine mathematische Bestimmung des wahrscheinlichsten Inputs
- keine mathematische Messung der Häufigkeit entsprechender Gespräche
- keine wissenschaftliche Modellinversion
- keine psychologische oder psychiatrische Diagnose
- kein Beweis für die Gedanken eines konkreten Täters
- keine echten Chatprotokolle, Beichten oder Geständnisse
- keine Bestätigung einzelner Buchdialoge durch spätere KI-Nutzungsstudien
Die Aussagekraft liegt nicht im Auffinden eines verborgenen Originals. Sie liegt in wiederkehrenden Beziehungen zwischen Rolle, Konflikt, Absicht und Sprache, die über kontrollierte Variationen hinweg sichtbar bleiben und nach der Forschungsthese durch reale Prompts, Trainingsbeispiele und menschliche Rückmeldungen im Modellverhalten mitgeprägt wurden.
12 · Verantwortung
Autorenschaft und Verantwortung
Das Sprachmodell erzeugt Textvarianten. Die Auswahl der Konstellationen, der Vergleich, die Musterbildung, die sprachliche Bearbeitung, die Einordnung und die ethische Verantwortung liegen beim Autor. Die Verwendung eines Modells entbindet nicht von Quellenkritik, begrifflicher Genauigkeit oder dem Schutz Betroffener.
Das Projekt macht deshalb den Unterschied zwischen erzeugtem Text und redaktioneller Aussage sichtbar. Es behauptet keine Authentizität, die nicht vorhanden ist.
Stand der Methodenbeschreibung: 31. Juli 2026