Wir sprechen mit KI.
Manchmal übernimmt sie Rollen, die bislang Menschen erfüllt haben: Nachhilfelehrer, medizinische Ratgeber:in, Faktenchecker:in, Steuerberater:in – und manchmal sogar Therapeut:in oder Freund:in. Manchmal entwickelt sich ein richtiger Dialog: Wir haken nach, lassen uns etwas genauer erklären, widersprechen einer Antwort oder bitten um eine neue Einschätzung.
Dass das kein Randphänomen mehr ist, zeigen verschiedene Untersuchungen. In einer US-amerikanischen Befragung von 2026 gab mehr als ein Viertel der internetnutzenden Erwachsenen an, große Sprachmodelle für soziale, emotionale oder persönliche Interaktionen zu verwenden. Eine Nutzungsstudie von Open AI zeigt, dass Menschen Chatbots hauptsächlich für Alltagstätigkeiten nutzen. Sie suchen Informationen, lassen sich beraten oder bitten um Rat für eine Entscheidung.
Auch in psychotherapeutischen Praxen ist diese Entwicklung angekommen: Mehr als drei Viertel der von der American Psychological Association befragten Psycholog*innen gaben an, dass Patient*innen davon berichtet hatten, KI-Chatbots für Diagnosen oder zur emotionalen Unterstützung zu nutzen.
Diese Entwicklung ist auch bei Jugendlichen sichtbar. 72 Prozent der 13- bis 17-Jährigen einer repräsentativen US-Befragung hatten bereits 2025 sogenannte AI Companions genutzt, also persönliche Gespräche mit KI-Chatbots geführt.
KI-Chatbots haben dabei ein ganz schön großes Anforderungsprofil zu erfüllen.
Ja, aber können KI-Chatbots das überhaupt?
Hinter der scheinbar einfachen Frage, wie gut eine KI eine bestimmte Rolle ausfüllen kann, verbirgt sich ein grundlegendes Problem: die Informationsasymmetrie zwischen Laien und Expert*innen. Laien fehlt das Expertenwissen. Wie können sie einschätzen, ob eine Aussage richtig, unvollständig oder falsch ist?
Bei KI-Systemen verschärft sich dieses Problem auf besondere Weise. Sprachmodelle sind keine allwissenden Orakel und auch keine Datenbanken, die für jede Frage eine eindeutig richtige Antwort abrufen. Sie erzeugen ihre Ausgaben, indem sie auf Grundlage ihrer Trainingsdaten und der jeweiligen Eingabe sprachlich wahrscheinliche Fortsetzungen berechnen. Das kann zu erstaunlich hilfreichen und präzisen Antworten führen. Gleichzeitig ist eine flüssige, selbstsichere oder gut strukturierte Formulierung kein verlässlicher Beleg für die Richtigkeit des Inhalts ist.
Wenn KI-Chatbots jedoch häufiger als allwissende Expert*innen im Alltag zu Rat gezogen werden, stellen sich im Kern zwei Fragen:
- Sollten wir KI-Modelle überhaupt nutzen, um uns zu informieren?
- Wann kann ein „Gespräch mit einer KI“ hilfreich sein und wann nicht?
So entstand die Idee für einen Podcast
Gemeinsam mit Christian Gisinger (Digitalisierungsbeauftragter der Evang. Landesarbeitsgemeinschaft für Erwachsenenbildung RLP) und Frank Schlegel (Medienpädagoge https://digitaldurstig.de/) entwickelte ich die Grundidee für den Podcast. Eigentlich war sie zunächst ziemlich einfach:
Ein Chatbot sollte in jedem Gespräch eine konkrete Rolle oder Aufgabe übernehmen. Mal als Gesprächspartnerin zu ethischen Fragen, mal als Nachhilfelehrer:in, mal als Faktenchecker:in. Nicht in einer künstlichen Testsituation, sondern möglichst praxisnah.
Das Konzept: Ein Mensch führt das Gespräch mit der KI. Danach wird gemeinsam mit einer Expert*in genauer hingeschaut: Wo war der KI-Chatbot hilfreich? Wo lag er daneben? Und vor allem: Wie sind wir mit dem KI-Chatbot umgegangen? Haben wir die Fragen gut formuliert oder uns und den Chatbot in die Irre geführt?
Von Anfang an war uns wichtig, die KI dabei nicht möglichst gut aussehen zu lassen. Fehler, Irritationen oder Halluzinationen sollten gerade nicht herausgeschnitten werden. Im ursprünglichen Konzept waren sie ausdrücklich als Teil des Lernprozesses gedacht.
Das Ziel war also nicht, zu zeigen, was KI alles kann. Es ging darum, Möglichkeiten und Grenzen in konkreten Situationen erfahrbar zu machen. Sensibilisierung, Orientierung und ein möglichst niedrigschwelliger Zugang zur Auseinandersetzung mit Chatbots standen dabei im Mittelpunkt.
Die Struktur der Folgen folgte deshalb einer einfachen Logik: ausprobieren, zuhören, einordnen und reflektieren.
Drei Pilotfolgen, drei Versuchsanordnungen
Aus dieser Idee entstanden drei Pilotfolgen. Jede testete eine andere Rolle von KI und setzte einen etwas anderen Schwerpunkt.
Folge 1: Wie spricht eine KI über ihre eigene Ethik?
In der ersten Folge haben wir ChatGPT zu seinen ethischen Leitlinien, Grenzen und Wertvorstellungen befragt. Ziel war es, zu beobachten, wie ein KI-System über die Regeln spricht, an denen es selbst ausgerichtet ist, und diese Antworten anschließend fachlich einzuordnen.
Folge 2: KI als Mathe-Nachhilfe
In der zweiten Folge wurde die KI als Lernbegleitung ausprobiert. Ein Kollege nutzte sie als Mathe-Nachhilfelehrer; anschließend wurde das Gespräch gemeinsam mit einem Mathematiklehrer betrachtet. Im Mittelpunkt stand die Frage, wie hilfreich und fachlich tragfähig die Unterstützung tatsächlich war.
Folge 3: KI als Faktenchecker
Die dritte Folge war experimenteller angelegt. Gemeinsam mit einer auf Faktenchecks spezialisierten Journalistin wurde direkt getestet, wie gut ein KI-System Informationen prüfen, einordnen und begründen kann.
Die drei Folgen sollten nicht abschließend beantworten, ob KI in einer bestimmten Rolle „gut“ oder „schlecht“ ist. Sie waren vielmehr drei Versuchsanordnungen – und drei Möglichkeiten, genauer hinzuschauen, was passiert, wenn wir einer KI Aufgaben übertragen, für die wir bislang vor allem Menschen gefragt hätten.
Was wir aus dem Podcast gelernt haben
Nach drei Pilotfolgen war für uns klar: Inhaltlich funktioniert die Idee.
Aus den drei Gesprächen ließen sich einige wiederkehrende Mechanismen beobachten. Zunächst wurde deutlich, wie stark die Qualität einer KI-Antwort davon abhängt, wie eine Frage gestellt wird. Präzise Formulierungen, zusätzlicher Kontext, Gegenfragen oder die Aufforderung, Unsicherheiten offenzulegen, können Antworten verbessern – sie verhindern aber nicht zuverlässig, dass ein Modell Zusammenhänge erfindet, Quellen falsch wiedergibt oder wichtige Einschränkungen auslässt. Gleichzeitig wirken viele Antworten klar, plausibel und selbstsicher. Gerade das kann trügerisch sein: Auch sachlich weitgehend richtige Erklärungen können verkürzen, Missverständnisse erzeugen oder mehr Sicherheit vermitteln, als inhaltlich gerechtfertigt wäre.
Hinzu kommt die Wirkung der Gesprächssituation selbst. Natürliche Sprache, menschlich klingende Stimmen und ein anthropomorphes Design lassen schnell in den Hintergrund treten, dass man mit einem Sprachmodell interagiert. KI-Chatbots antworten meist geduldig, konstant und lösungsorientiert. Sie wirken weder genervt noch unkonzentriert und vermitteln dadurch leicht Verlässlichkeit und Professionalität. Diese Form der Kommunikation beeinflusst auch, wie wir die vermittelten Informationen wahrnehmen und bewerten.
Gerade im Vergleich mit menschlichen Expert*innen zeigt sich deshalb ein weiterer wichtiger Unterschied: Fachliche Expertise besteht nicht nur aus abrufbarem Wissen. Sie umfasst häufig auch Erfahrungswissen, situative Einschätzung, das Erkennen von Unsicherheiten und die Fähigkeit, einen konkreten Fall in einen größeren Zusammenhang einzuordnen.
Wichtige Erkenntnisse also, die für eine verantwortungsvolle Nutzung bedeutsam sind.
Gleichzeitig zeigte sich aber auch sehr schnell, wo das Format an Grenzen stößt:
KI-Modelle entwickeln sich in einem Tempo weiter, mit dem wir in unserem Arbeitsalltag kaum mithalten konnten. Was wir ausprobierten und aufzeichneten, konnte wenige Wochen später schon wieder unter anderen technischen Voraussetzungen stattfinden.
Dazu kam der Produktionsaufwand. Eine Podcastfolge entsteht eben nicht nebenbei. Ein Thema muss vorbereitet, ein Gespräch geführt, ausgewertet, aufgenommen und geschnitten werden.
Für uns kam all das zusätzlich zu unserer eigentlichen Arbeit hinzu.
Irgendwann mussten wir uns deshalb die Frage stellen: Können wir das Format in dieser Form überhaupt weiterführen?
Und genau an diesem Punkt wurde es interessant.
Beim Blick auf die drei Pilotfolgen merkten wir, dass sich hinter ihnen ein gemeinsames Muster verbarg. Eigentlich hatten wir jedes Mal dasselbe getan:
- Wir haben einer KI eine Aufgabe gegeben.
- Wir haben beobachtet, wie sie damit umgeht.
- Wir haben das Gespräch bewertet.
- Und wir haben unsere Einschätzung mit fachlicher Expertise abgeglichen.
Damit verschob sich unser Blick auf das Projekt. Vielleicht war gar nicht der fertige Podcast das eigentlich Interessante. Vielleicht war es das Verfahren dahinter.
Vom Podcast zur Methode
Aus dieser Erkenntnis entstand die Idee, die Grundstruktur des Podcasts in eine Bildungsmethode zu übersetzen.
Denn das ursprüngliche Konzept hatte diese Richtung bereits angelegt: KI sollte nicht nur erklärt, sondern erfahrbar gemacht werden. Fehler und Grenzen sollten sichtbar bleiben und anschließend reflektiert werden.
Der Unterschied ist nur: In einer Bildungsveranstaltung oder einem Seminar hören die Teilnehmenden nicht mehr anderen beim Experimentieren zu. Sie experimentieren selbst.
Die Methode auf einen Blick
1. Aufgabe wählen
Die KI bekommt eine konkrete, realistische Aufgabe.
Beispiele:
- Nachhilfe geben
- Informationen prüfen
- etwas erklären
- bei einer Entscheidung beraten
- ein Gespräch unterstützen
2. Gespräch führen
Die Teilnehmenden interagieren selbst mit dem KI-System. Nicht der perfekte Prompt steht im Mittelpunkt, sondern die tatsächliche Gesprächssituation.
3. Eigene Einschätzung festhalten
Vor jeder fachlichen Einordnung bewerten die Teilnehmenden zunächst selbst:
- War die Antwort verständlich?
- Wirkte sie überzeugend?
- Hat die KI geholfen?
- Wo entstanden Zweifel?
- Würde ich mich auf die Antwort verlassen?
4. Fachlichen Gegencheck durchführen
Eine Person mit Expertise im jeweiligen Themenfeld bewertet dasselbe Gespräch:
- Stimmen die Aussagen?
- Was fehlt?
- Welche Fehler sind möglicherweise unbemerkt geblieben?
- Was hat die KI tatsächlich gut gemacht?
- Wo war die Sprache überzeugender als der Inhalt?
5. Gemeinsam reflektieren
Zum Schluss werden beide Perspektiven zusammengebracht:
- Was haben wir selbst wahrgenommen?
- Was hat die fachliche Einschätzung verändert?
- Wo lagen Unterschiede?
- Was bedeutet das für unseren zukünftigen Umgang mit KI?
Kurz gesagt:
Ausprobieren → beobachten → selbst einschätzen → fachlich prüfen → gemeinsam reflektieren
Was bleibt?
Die zentrale Erkenntnis aus dem Projekt ist für uns deshalb recht klar: Der kompetente Umgang mit KI entscheidet sich nicht allein daran, ob wir gute Prompts formulieren können. Entscheidend ist, ob wir die Antworten einordnen können.
Gerade dort, wo uns eigenes Fachwissen fehlt, wird das schwierig. Eine Antwort kann plausibel wirken, und trotzdem unvollständig oder falsch sein. Deshalb braucht es neben dem Ausprobieren immer auch Vergleich, fachliche Einordnung und Reflexion.
Genau hier setzt die Methode „Gespräche mit einer KI“ an. Sie soll nicht zeigen, ob KI grundsätzlich „gut“ oder „schlecht“ ist. Sie schafft einen Reflexionsrahmen, in dem sichtbar wird, wo sowohl wir als auch ein KI-Modell an seine Grenzen stößt.
Für uns ist die Methode deshalb vor allem eine Aufforderung zum Ausprobieren und ein Ausgangspunkt für weitere Diskussionen. Welche Aufgaben übertragen wir künftig an KI? Wo vertrauen wir ihren Antworten? Wo brauchen wir Gegenchecks? Und welche Formen der Urteilskompetenz werden wichtiger, wenn KI-Systeme immer selbstverständlicher Teil unseres Alltags werden?
Darüber möchten wir weiter ins Gespräch kommen und laden dazu ein, die Methode auszuprobieren, weiterzuentwickeln und kritisch zu diskutieren.




