Entscheidungsmodelle: KI, die nur Ja, Nein oder Kategorie sagt
11. Oktober 2026
KI-generiert, redaktionell von 8thsense ausgewählt, geprüft und freigegeben. EU AI Act, Art. 50
Eine neue Klasse von KI-Modellen schreibt keine Texte mehr, sondern trifft Entscheidungen: Ja oder Nein, Kategorie A, B oder C, Dringlichkeit 1 bis 5. Nach dem Start von Jev des Start-ups TypeSafe im September haben inzwischen auch OpenAI mit seiner Decisions API und Microsoft mit Microsoft-Decision-1 eigene Entscheidungsmodelle (Decision Models) vorgestellt. Für Geschäftsführer ist das interessanter als der nächste Chatbot: Diese Modelle sind schnell, kosten Bruchteile eines Cents pro Vorgang und liefern zu jeder Antwort eine Wahrscheinlichkeit, die sich prüfen lässt. Genau das braucht, wer E-Mails sortieren, Anfragen weiterleiten oder Belege vorprüfen will.
Was ein Entscheidungsmodell anders macht
Ein klassisches Sprachmodell antwortet in Fließtext, und dieser Text muss erst interpretiert werden, bevor eine Software damit arbeiten kann. Ein Entscheidungsmodell bekommt dagegen eine feste Frage und eine vorgegebene Antwortliste. Zurück kommt ausschließlich eine dieser Antworten samt Wahrscheinlichkeit. Bei OpenAI heißen die drei Fragetypen predicate (trifft eine Bedingung zu, mit Wahrscheinlichkeit von 0 bis 1), choice (eine Option aus einer selbst definierten Liste) und score (Einstufung auf einer geordneten Skala). OpenAI empfiehlt ausdrücklich eine Auffangkategorie wie „Sonstiges” für Fälle, die in kein Raster passen (Quelle: developers.openai.com). TypeSafe beschreibt Jev ähnlich: Man legt Schwellenwerte fest, ab denen die Software selbst handelt und unterhalb derer ein Mensch prüft (Quelle: typesafe.ai). Das Modell kann sich also nicht in ausschweifenden Antworten verlieren. Es kann aber trotzdem falsch liegen.
Wer anbietet und was es kostet
Der Markt ist binnen weniger Wochen voll geworden. The Register zählt neben TypeSafe, OpenAI und Microsoft unter anderem Cloudflare, Perplexity, Snowflake, Liquid AI und H2O.ai als Anbieter und verweist auf mehr als 100 solcher Modelle bei Hugging Face (Quelle: theregister.com). Die Preise liegen weit unter denen klassischer Modelle, Ausgabe-Tokens sind jeweils kostenlos:
TypeSafe Jev: 0,042 US-Dollar pro Million Eingabe-Tokens, derzeit im Early Access (Quelle: theregister.com)
Microsoft-Decision-1: ebenfalls 0,042 US-Dollar pro Million Eingabe-Tokens, verfügbar in Microsoft Foundry. Basis ist das offene Modell Qwen3.5-9B von Alibaba, das Microsoft nachtrainiert hat und später auf eigene sowie OpenAI-Modelle umstellen will (Quelle: commandline.microsoft.com)
OpenAI Decisions API: 0,10 US-Dollar pro Million Eingabe-Tokens, öffentliche Beta, mit Datenverarbeitung auch in Europa (EWR und Schweiz)
Zur Einordnung ein grobes Rechenbeispiel: 10.000 eingehende E-Mails im Monat mit je rund 500 Tokens ergeben fünf Millionen Tokens, also je nach Anbieter zwischen etwa 0,20 und 0,50 US-Dollar. Die Rechenkosten sind damit praktisch kein Kriterium mehr. Teuer wird die Einrichtung, nicht der Betrieb.
Herstellerzahlen sind keine Messung
Microsoft wirbt mit der höchsten Genauigkeit in einem Vergleich über 36 Benchmarks und mit deutlich kürzeren Antwortzeiten als die Konkurrenz. Alle diese Werte stammen aus eigenen Tests, eine unabhängige Überprüfung gibt es bisher nicht. Selbst der Microsoft-Beitrag nennt das Ziel einer sauberen Kalibrierung (eine 90-Prozent-Aussage soll in neun von zehn Fällen stimmen), veröffentlicht dazu aber keine Messwerte. Aufschlussreicher ist ein Test von Cisco: Dort schnitt Jev ohne jedes Training bei der Erkennung problematischer Inhalte erstaunlich gut ab und lag nah an einem deutlich größeren Sprachmodell. Ein speziell auf die eigenen Kategorien trainierter Klassifikator war aber klar besser, etwa 61 gegenüber 34 Prozent Trefferquote bei sehr niedriger Fehlalarmrate (Quelle: blogs.cisco.com). Die Cisco-Autoren sehen beide Ansätze als Ergänzung: Klassifikator für Routinemengen, Entscheidungsmodell für neue oder wechselnde Kategorien.
Wo das im Mittelstand passt
Entscheidungsmodelle lohnen sich überall dort, wo heute jemand Eingänge liest, nur um sie weiterzuleiten. Typische Kandidaten:
Posteingang sortieren: Ist die Mail eine Rechnung, eine Bewerbung, eine Beschwerde oder eine Terminanfrage?
Anfragen routen: Ein Pflegedienst ordnet Kontaktformulare nach Dringlichkeit, eine Tanzschule nach Kursart.
Belege vorprüfen: Enthält der Beleg alle Pflichtangaben, ja oder nein?
Bewertungen einstufen: Muss eine Google-Rezension heute beantwortet werden?
Die Grenze ist klar: Sobald es um Entscheidungen über Menschen geht, etwa Bewerbungen, Kredite oder Gesundheit, darf das Modell vorsortieren, aber nicht allein entscheiden. Wer hier automatisiert entscheiden lässt, berührt zudem schnell die Regeln von DSGVO und EU AI Act.
Was das für Unternehmen bedeutet
Der günstige Preis verführt dazu, einfach loszulegen. Der eigentliche Aufwand liegt woanders: Die Kategorien müssen zu den realen Abläufen passen, und die Fehlerquote muss vor dem Einsatz an eigenen Daten gemessen werden. OpenAI rät genau dazu, Schwellenwerte mit gelabelten Beispielen aus der eigenen Anwendung festzulegen und dabei abzuwägen, was ein Fehlalarm und was ein übersehener Fall kostet. Praktisch heißt das: 200 bis 300 echte, anonymisierte E-Mails von Hand einsortieren, das Modell darauf laufen lassen und vergleichen. Erst wenn die Trefferquote bei hoher Wahrscheinlichkeit stimmt, darf die Software selbst weiterleiten, alles Unsichere landet bei einem Menschen.
Die zweite Hürde ist die Anbindung. Ein Entscheidungsmodell allein sortiert nichts, es muss an Postfach, CRM oder Buchhaltung angeschlossen werden, und genau hier scheitern viele Pilotprojekte an Insellösungen ohne Schnittstelle. Wer klein starten will, nimmt einen einzigen Eingangskanal, definiert drei bis fünf Kategorien plus „Sonstiges” und baut die Weiterleitung als Teil einer bestehenden KI-Automation auf. Dazu braucht es jemanden, der sowohl die Prozesse im Betrieb als auch die Technik versteht und die Testphase begleitet. Ein Chatbot mit Freitext ist dafür das falsche Werkzeug, ein eng begrenzter, gemessener Entscheider oft das richtige.