Fertiges KI-Werkzeug oder integrierter Assistent: wann eine Anpassung nötig ist
Entscheiden, ob ein verfügbares Produkt den Bedarf deckt oder spezifische Integrationen erfordert.
SqualiOnline Redaktion · 2026-09-07
Die Frage, die in die Irre führt, lautet „welche künstliche Intelligenz ist die beste“. Die Frage, die zu einer Entscheidung führt, ist langweiliger: Liefert diese Aufgabe, ausgeführt mit dem Werkzeug, das das Unternehmen bereits bezahlt, ein brauchbares Ergebnis? Lautet die Antwort ja, gibt es nichts zu entwickeln. Lautet sie nein, sagt der Grund für das Nein genau, was gebaut werden muss.
Fast alle Bewertungen scheitern, weil Produkte statt Aufgaben verglichen werden. Ein Produkt wird abstrakt beurteilt, und es gewinnt immer die beste Vorführung; eine Aufgabe wird am Ergebnis beurteilt, und das Ergebnis können Sie selbst erkennen.
Zuerst die Aufgabe festlegen, dann die Werkzeuge betrachten
Eine bewertbare Aufgabe ist spezifisch, wiederkehrend und hat ein erkennbares Ergebnis. Sie muss in vier Zeilen aufgeschrieben werden.
- Was hineingeht: eine Nachricht, ein Dokument, eine Aufzeichnung, eine Frage.
- Was herauskommen muss und in welcher Form: ein Text, eine Zeile in einem System, eine Klassifizierung, eine Antwort an einen Kunden.
- Wer es heute macht, wie oft pro Woche und wie viel Zeit es kostet.
- Was ein Ergebnis akzeptabel macht und was es inakzeptabel macht. Das ist der Teil, den fast niemand aufschreibt, und der einzige, der einen Vergleich überhaupt ermöglicht.
„Künstliche Intelligenz für den Kundenservice nutzen“ ist keine Aufgabe, sondern eine Kategorie. „Eingehende Anfragen klassifizieren und die Antwort für die drei häufigsten Kategorien vorschlagen“ ist eine, und sie lässt sich in einer Woche testen.
Der Test: gleicher Fall, gleiche Kriterien, gleiche Personen
Der Vergleich ist nur sinnvoll, wenn er vergleichbar ist. Ein Mindestprotokoll, das keine technischen Kompetenzen erfordert.
- Man sammelt zwanzig bis dreißig bereits bearbeitete reale Fälle, einschließlich der schwierigen und jener, bei denen die Person einen Fehler gemacht hat. Nur einfache Fälle führen zu einer falschen Schlussfolgerung.
- Man legt vorab fest, wie beurteilt wird: welche Fehler akzeptabel sind und welche nicht. Ein Fehler, den der Empfänger nicht bemerken würde, und einer, der einem Kunden eine falsche Angabe übermittelt, wiegen nicht gleich schwer.
- Jeder getesteten Lösung wird dasselbe Material gegeben, Anweisungen eingeschlossen. Erhält eine bessere Vorgaben als die anderen, messen Sie, wer die Anweisungen geschrieben hat.
- Beurteilt wird von der Person, die diese Arbeit heute macht, nicht von der, die das Werkzeug vorgeschlagen hat.
- Auch die Überprüfungszeit wird notiert. Eine Lösung, die leicht bessere Ergebnisse liefert, aber Zeile für Zeile kontrolliert werden muss, kann mehr kosten als die Arbeit, die sie ersetzt.
Die vier Prüfungen, die ein fertiges Produkt von einem integrierten System unterscheiden
Reicht der Test mit dem generischen Werkzeug nicht aus, liegt der Grund fast immer in einem dieser vier Punkte. Zu erkennen, in welchem, verhindert, mehr zu entwickeln als nötig.
| Prüfung | Konkrete Frage | Wenn sie fehlt |
|---|---|---|
| Quellen | Kann es auf Ihre aktuellen Dokumente, Preislisten und Verläufe zugreifen? | Die Antworten sind plausibel, aber nicht Ihre eigenen: Eine Anbindung an die Quellen ist nötig |
| Zugänge | Wer sieht was, und bleiben vertrauliche Daten vertraulich? | Das Produkt ist für Daten, die nicht zirkulieren dürfen, nicht nutzbar |
| Aktionen | Muss es nur antworten oder auch in ein eigenes System schreiben? | Es braucht Integrationen und Kontrollen: Das ist ein Projekt anderer Art |
| Grenzen | Hält es die tatsächlich genutzten Volumen, Formate und Sprachen aus? | Funktioniert im Test und versagt im Alltag: Muss unter realer Last geprüft werden |
Viele Situationen lösen sich mit einem Standardprodukt plus einer Anbindung an die richtigen Quellen, ohne ein System zu bauen. Das ist die Lösung, die niemand vorschlägt, weil sie am wenigsten verkaufbar ist, und oft ist sie die sinnvollste.
Was ein fertiges Produkt besser kann als eine Entwicklung
Es lohnt sich, das aufzuzählen, denn im Eifer der Anpassung werden echte Vorteile weggeworfen.
- Es verbessert sich, ohne dass Sie etwas tun müssen, und hängt nicht von einer einzigen Person ab, die weiß, wie es aufgebaut ist.
- Es kostet weniger im Start und erlaubt es, die Meinung zu ändern. Ein dreiwöchiger, dann abgebrochener Test ist ein gutes Ergebnis, keine Verschwendung.
- Es wurde bereits von vielen genutzt: Offensichtliche Probleme sind anderswo aufgetreten, nicht bei Ihnen.
- Es erzeugt keinen eigenen Wartungsaufwand. Alles individuell Gebaute muss gewartet werden, und die Wartung endet nie.
Eine individuelle Entwicklung ist gerechtfertigt, wenn die Aufgabe von Daten, Regeln oder Systemen abhängt, die nur Ihnen gehören, wenn die Daten nicht nach außen dürfen oder wenn derselbe Vorgang so oft wiederholt wird, dass die manuelle Arbeit nicht mehr tragbar ist.
Die unsichtbaren Kosten: Aufsicht und Wartung
Der ehrliche Vergleich ist nicht der zwischen der Abogebühr eines Produkts und dem Kostenvoranschlag einer Entwicklung. Entscheidend sind die wiederkehrenden Posten, und sie gelten für beide Wege.
- Wer die Ergebnisse kontrolliert, wie häufig und wie lange, bevor die Kontrolle gelockert wird.
- Wer die Quellen aktualisiert, wenn sich Preislisten, Verfahren oder Dokumente ändern. Ein System, das auf Basis veralteter Dokumente antwortet, ist schlechter als eines, das gar nicht antwortet.
- Wer eingreift, wenn eine Verbindung ausfällt oder ein Zugang abläuft, und in welcher Zeit.
- Was passiert, wenn die zuständige Person nicht verfügbar ist. Das gilt für den Anbieter ebenso wie für Sie.
Standard und Maßlösung können nebeneinander bestehen
Die Wahl ist selten eindeutig. Die stabilste Lösung behält als Standard alles bei, was Sie nicht unterscheidet, und baut nur den Teil individuell, der von Ihnen abhängt: Ihre Quellen, Ihre Regeln, die Anbindung an Ihre Systeme. Es lohnt sich auch, von Anfang an festzuhalten, was bei einem Werkzeugwechsel Ihnen erhalten bliebe — die aufbereiteten Dokumente, die Anweisungen, die Testfälle, die gesammelten Daten —, denn genau das erlaubt es, die Meinung zu ändern, ohne von vorne anzufangen.
Was dieser Leitfaden nicht behandelt
Hier geht es um die Wahl zwischen dem, was verfügbar ist, und dem, was für Ihren Fall gebaut werden muss. Sie finden hier keine Modell-Rankings oder allgemeinen Produktvergleiche: Sie ändern sich mit der Zeit und wären nicht mit Ihrer Arbeit vergleichbar. Die Unterscheidung zwischen klassischer Automatisierung und künstlicher Intelligenz sowie die Kostenposten für den laufenden Betrieb eines Assistenten werden gesondert behandelt.
Häufig gestellte Fragen
Wie lange muss ein Test dauern?
Lang genug, um auf die schwierigen Fälle zu stoßen, die meist einer von zehn sind. Mit zwanzig bis dreißig realen Fällen kommt man in ein bis zwei Wochen zu einer Antwort; über einen Monat hinaus hört der Test auf, ein Test zu sein, und wird zu einer unentschiedenen Nutzung, mit dem Risiko, dass niemand die endgültige Entscheidung übernimmt.
Können wir unsere Dokumente mit einem generischen Werkzeug verwenden?
Das hängt von den Nutzungsbedingungen des Dienstes und der Art der Daten ab. Bevor Sie irgendetwas hochladen, sind zwei Punkte zu prüfen: was der Anbieter angibt, mit dem eingesandten Material zu tun, und ob sich unter diesen Dokumenten personenbezogene Daten oder vertrauliche Informationen Ihrer Kunden befinden. Für den Test kann fast immer mit anonymisiertem Material gearbeitet werden.
Lohnt es sich, auf bessere Werkzeuge zu warten?
Warten bringt nichts von dem, was ohnehin gebraucht wird: geordnete Dokumente, Testfälle, Abnahmekriterien, Personen, die ein gutes Ergebnis erkennen können. Diese Arbeit bleibt mit jedem Werkzeug gültig, und wer sie geleistet hat, führt das nächste Werkzeug in Tagen statt in Monaten ein.
Wir vergleichen gemeinsam verfügbare Werkzeuge und individuelle Entwicklung.
Wenn Sie darüber sprechen möchten, ist dafür Künstliche Intelligenz zuständig.

