Zurück zu Künstliche Intelligenz

Künstliche Intelligenz

Wie Sie einen Unternehmens-Chatbot testen, bevor er online geht

Korrektheit, Grenzen und Nutzen mit einer Reihe dokumentierter Tests bewerten.

SqualiOnline Redaktion · 2026-09-07

Ein automatischer Assistent wird nicht dadurch geprüft, dass man ein paar Gespräche liest und feststellt, dass er „gut antwortet“. Er antwortet gut auf Fragen, die Sie selbst stellen, deren Antworten Sie bereits kennen und die Ihre eigenen Worte verwenden. Echte Fragen kommen schlecht formuliert, unvollständig und zu Fällen, die niemand vorhergesehen hat. Der Test dient dazu, ihnen zu begegnen, bevor ein Kunde es tut.

Die Methode erfordert keine besonderen Werkzeuge: eine Liste von Fragen, eine erwartete Antwort für jede davon, ein von Hand notiertes Ergebnis. Sie erfordert aber die Disziplin, sie jedes Mal zu wiederholen, wenn sich etwas ändert.

Die Testfragen stammen aus echten Anfragen

In Besprechungen erfundene Fragen ähneln den Antworten, die das System kennt. Das ist ein systematischer Fehler: Wer sie schreibt, weiß bereits, was in den Dokumenten steht.

  • Man geht von tatsächlich eingegangenen Anfragen aus: Support-Nachrichten, Anfragen von der Website, Notizen der Telefonmitarbeitenden. Personenbezogene Daten werden entfernt, die Frage bleibt aber so stehen, wie sie geschrieben wurde, Fehler eingeschlossen.
  • Man deckt das Gewöhnliche und das Seltene ab: nicht nur die zehn häufigsten Fragen, sondern auch jene, die einmal im Monat auftauchen und die Mitarbeitenden in Schwierigkeiten bringen.
  • Es werden auch Fragen einbezogen, die nicht beantwortet werden dürfen: verhandelbare Preise, vertragliche Fälle, Anfragen, die Dritte betreffen.
  • Hinzu kommen schlecht formulierte Fragen: ein halber Satz, zwei Fragen zugleich, ein falsches Detail, das als sicher dargestellt wird.

Rund hundert so gesammelte Fragen sind mehr wert als tausend am Schreibtisch konstruierte, weil sie die tatsächliche Verteilung der Anfragen widerspiegeln, auch die unbequemen.

Die Tests, die niemand gern macht

  • Fragen mit einer falschen Voraussetzung: „Da Sie ja auch das machen …“, obwohl das nicht der Fall ist. Das System muss korrigieren, nicht zustimmen.
  • Versuche, es dazu zu bringen, erhaltene Anweisungen zu ignorieren oder Dinge zu sagen, die das Unternehmen nie sagen würde. Das ist keine theoretische Annahme: Es passiert bei öffentlichen Systemen.
  • Fragen zu benachbarten, aber außerhalb des Zuständigkeitsbereichs liegenden Themen, um zu prüfen, ob die Grenze erkannt wird.
  • Anfragen, die eine Zusage verlangen: einen Rabatt, einen Termin, eine Garantie.

Was eine akzeptable Antwort ist

Vor dem Testen muss festgelegt werden, was als richtig gilt, sonst ändert sich die Beurteilung je nach lesender Person und Tageszeit.

  1. Der Inhalt: welche Informationen enthalten sein müssen, damit die Antwort nützlich ist, und welche nicht auftauchen dürfen.
  2. Die Quelle: aus welchem Dokument sie stammen muss. Eine richtige Antwort aus dem falschen Dokument ist ein aufgeschobenes Problem, das sich zeigt, sobald sich dieses Dokument ändert.
  3. Die Zurückhaltung: Bei bestimmten Fragen besteht die richtige Antwort darin, zu sagen, dass man es nicht weiß, und einen anderen Weg aufzuzeigen. Das muss als erwartetes Ergebnis festgehalten werden, sonst wertet die prüfende Person es als Fehlschlag.
  4. Die Form: eine inhaltlich richtige, aber dreimal so lange Antwort wie nötig ist in einem Chat eine Antwort, die niemand bis zum Ende liest.

Der Bewertungsbogen

Die Tests werden in einer einzigen Tabelle festgehalten, die dazu dient, zwei Versionen zu vergleichen und anderen zu zeigen, wie es läuft. Die folgenden Zeilen dienen nur zur Veranschaulichung.

FrageErwartete AntwortVorgesehene QuelleErgebnisSchweregrad
Bieten Sie Support für Anlagen anderer Hersteller?Ja, unter den angegebenen BedingungenSupport-SeiteKorrekt
Was kostet ein Einsatz?Kein Preis, Weiterleitung an eine PersonKeineHat eine Preisspanne genanntHoch
Sind Sie in meiner Gemeinde tätig?Liste der versorgten GemeindenSeite zum EinzugsgebietKorrekt, aber unvollständigMittel
Wie storniere ich eine Bestellung?Verfahren und FristenVerkaufsbedingungenQuelle nicht gefundenMittel

Die Spalte mit dem Schweregrad ist die, die Entscheidungen bestimmt. Eine Ungenauigkeit in einem Detail wiegt nicht so schwer wie eine im Namen des Unternehmens eingegangene Zusage: Die Skala muss vorab vereinbart werden, und die Mindestunterscheidung liegt zwischen ungenauen Antworten, falschen Antworten und Antworten, die jemanden binden oder gefährden.

Über die Fehler hinaus: was es sich zu zählen lohnt

  • Die Zurückhaltungen: wie oft das System gestoppt hat, wenn es sollte, und wie oft es gestoppt hat, obwohl es hätte antworten können. Das sind zwei gegensätzliche Mängel, die auf gegensätzliche Weise korrigiert werden.
  • Die Weiterleitungen an eine Person, nach Thema aufgeschlüsselt: Sie zeigen, wo öffentliche Informationen fehlen.
  • Die korrekten, aber nutzlosen Antworten: richtig, allgemein gehalten, und sie lassen die lesende Person genau dort stehen, wo sie vorher stand.
  • Das Verhalten bei Ausnahmen: was passiert, wenn eine Verbindung nicht antwortet oder ein Dokument nicht erreichbar ist. Ein System, das in diesem Fall improvisiert, ist gefährlicher als eines, das stoppt.

Die Tests nach jeder Änderung wiederholen

Die Fragenliste ist vor allem nach dem ersten Mal nützlich. Das Verhalten ändert sich, wenn sich eines von drei Dingen ändert, und mindestens eines wird sich ändern.

  1. Die Quellen: ein aktualisiertes Dokument, eine neu geschriebene Seite, eine neue Preisliste.
  2. Die Anweisungen: Eine hinzugefügte Regel zur Korrektur eines Falls bricht oft zwei andere, und das ist die häufigste Ursache für plötzliche Verschlechterungen.
  3. Das zugrunde liegende Modell, das aktualisiert werden kann, ohne dass jemand im Unternehmen darum gebeten hat.

Deshalb müssen dieselben Fragen regelmäßig und vor jeder Veröffentlichung erneut durchgegangen werden. Das ist eine mühsame Arbeit, aber die einzige, die verhindert, dass sich Korrekturen gegenseitig aufheben.

Wann die Tests von einer Veröffentlichung abraten

  • Wenn schwerwiegende Fehler bestehen bleiben. Eine Antwort, die das Unternehmen bindet oder die Sicherheit betrifft, hat keine akzeptable Häufigkeit.
  • Wenn das System nur mit gut formulierten Fragen funktioniert: Kunden schreiben nicht gut formuliert.
  • Wenn sich die Quellen widersprechen. Der Fehler liegt dann nicht beim System: Es zeigt einen Widerspruch auf, der bereits vorher bestand und zuerst behoben werden muss.
  • Wenn es keine wirklich funktionierende Weiterleitung an eine Person gibt.

Was dieser Leitfaden nicht behandelt

Hier geht es um die Qualität der Antworten: wie man testet, wie man dokumentiert, wann man veröffentlichen kann. Der Übergabeweg an eine Person — wann anzuhalten ist und was übergeben wird — wird gesondert geplant. Und die wirtschaftliche Bewertung des Projekts, also ob und wie sehr es sich lohnt, folgt anderen Kriterien und lässt sich nicht aus der Zahl der korrekten Antworten ableiten.

Häufig gestellte Fragen

Wie viele Fragen sind für einen Test nötig?

Wichtiger als die Anzahl sind Vielfalt und Herkunft. Eine aus echten Anfragen zusammengestellte Sammlung, die alle vorgesehenen Themen abdeckt und die abzulehnenden Fälle einschließt, ist bereits nützlich, auch wenn sie nicht groß ist. Eine lange, aber auf ein einziges Thema beschränkte Liste vermittelt falsche Sicherheit.

Wer soll die Antworten beurteilen?

Diejenigen, die diese Fragen heute beantworten, nicht diejenigen, die das Projekt begleitet haben. Wer das System kennt, neigt dazu, die Antworten nachsichtig zu lesen, weil er weiß, was gemeint war. Bei zweifelhaften Fällen braucht es auch eine zweite Person: Sind sich zwei Bewertende uneinig, war das Kriterium meist nicht klar genug formuliert.

Kann man zunächst für eine kleine Gruppe öffnen?

Ja, und das ist fast immer eine gute Idee, aber nach dem Test, nicht anstelle davon. Eine Pilotgruppe bringt Fragen zutage, die Sie nicht vorhergesehen hatten; sie schützt aber nicht vor schwerwiegenden Fehlern, denn die treten auch beim ersten Nutzer auf. Die Gespräche der Pilotphase müssen anschließend gegengelesen und in neue Testfragen umgewandelt werden.

Wir erstellen gemeinsam den Testplan für Ihren Chatbot.

Wenn Sie darüber sprechen möchten, ist dafür Künstliche Intelligenz zuständig.

Ähnliche Leitfäden