Notizie IA Logo

AITalk

Nachrichten und Analysen zur Künstlichen Intelligenz

Jev chattet nicht, es entscheidet

Generative AIResearchApplications

jev.jpg

Nur wenige Tage nach dem Start zwingt ein Modell, das kein einziges Wort schreibt, zu der Frage, wozu künstliche Intelligenz wirklich dient. Sprachmodelle sind im Chat seit Jahren übermenschlich, aber wo bleibt die Automatisierung? Das ist die Frage, mit der Diogo Almeida den Launch-Beitrag zu Jev eröffnet, welcher am 15. September 2026 veröffentlicht wurde. Er sagt, er verfolge diese Idee seit vier Jahren. Er leitet TypeSafe, ein junges Start-up aus San Francisco, das laut The Register und TS2 40 Millionen Dollar in einer von DCVC geführten Finanzierungsrunde eingeworben hat.

Sein Werdegang ist das erste Argument für das Projekt. Almeida gehört zu den Hauptautoren von InstructGPT, OpenAIs grundlegender Arbeit zum Training mit menschlichem Feedback, und TechCrunch stellt ihn als einen der Erfinder von RLHF vor. Hier ist Präzision geboten: Die Idee, ein System nach menschlichen Präferenzen zu trainieren, wurde in einem Paper aus dem Jahr 2017 von sechs Autoren formalisiert, unter denen sein Name nicht steht. Vorsichtiger ausgedrückt hat er dazu beigetragen, sie in Chatbots zu integrieren, wie es auch DCVC in der von TS2 zitierten Pressemitteilung andeutet.

Das Paradoxon liegt auf dem Tisch: übermenschliche Chatbots, aber die Automatisierung bleibt langsam und teuer. TypeSafes Antwort ist ein Modell, das auf Textgenerierung komplett verzichtet. Es konversiert nicht, erklärt nicht und erzählt keine Geschichten. Wie Melvilles Schreiber Bartleby würde es lieber darauf verzichten. Aber eines tut es: Es entscheidet.

Der Aufsatz und der Lichtschalter

Um das Licht in einem Raum einzuschalten, sollten Sie nicht erst einen Aufsatz schreiben müssen, in dem Sie erklären, dass es dunkel ist, um ihn dann jemandem zu übergeben, der ihn liest und entscheidet, ob der Schalter gedrückt wird. Die Automatisierung mit einem Sprachmodell funktioniert derzeit ganz ähnlich. Das Programm übergibt dem Modell einen unstrukturierten Zustand, etwa ein Chat-Protokoll mit einem Kunden; das Modell generiert Wort für Wort Text; ein zweites Stück Code liest diesen Text und leitet daraus die Entscheidung ab.

Die Kosten zeigen sich an drei Punkten. Erstens die Zeit: Laut einer von TypeSafe zitierten unabhängigen Messseite antworten Spitzenmodelle in einem Intervall von 3 bis 329 Sekunden—akzeptabel in einem Chat, aber schwerfällig innerhalb eines Programms. Zweitens der Preis: Der Beitrag nennt 0,20 bis 10 Dollar pro Million Input-Tokens, wobei der Output etwa fünfmal teurer ist. Drittens der Ingenieuraufwand. David Linthicum, ein von InfoWorld befragter Berater, vergleicht den Einsatz eines Generalistenmodells für eine einfache Ja/Nein-Entscheidung damit, einen ganzen Unternehmens-Service-Bus für eine einfache Routing-Frage zu mobilisieren, und erinnert an die Schichten aus Prompts, Schemata, Validierungen, Wiederholungsversuchen und Leitplanken, die Techniker um freien Text herum bauen.

Hinzu kommt das Vertrauen. Ein Modell, das eine Aufgabe in 95 % der Fälle gut erledigt, aber nicht sagt, welche die restlichen 5 % sind, automatisiert diese Aufgabe laut TypeSafe nicht wirklich: Sie wissen, dass es Fehler macht, aber nicht wann. LangChain fügt hinzu, dass Tool Calling und strukturierte Ausgaben geholfen haben, aber die Agentenschleife bleibt langsam und teuer, weil jede Entscheidung einen weiteren Modellaufruf erfordert.

Schnelles Denken, langsames Denken

TypeSafe hat seine neue Kategorie in Anlehnung an Daniel Kahnemans Schnelles Denken, langsames Denken System One Models genannt, wobei System 1 für das schnelle, intuitive Denken steht und System 2 für das langsame, bedächtige. Im System von TypeSafe stehen traditionelle Sprachmodelle auf der langsamen Seite; Jev soll der schnelle Spiegel sein. Unstrukturierter Zustand geht hinein; typisierte Entscheidungen mit einer Wahrscheinlichkeit kommen heraus, ohne dass ein einziger Satz gebildet wird. Der Beitrag fasst es als Funktionsaufruf zusammen, der von Frontier-Intelligenz angetrieben wird.

Die Metapher hat ihren Preis. Die FAQ desselben Beitrags räumen ein, dass „System 1“ Assoziationen zu Fehleranfälligkeit weckt, und versprechen, später zu erklären, warum diese Modelle zuverlässiger sein können. Sean Goedecke, Autor eines technischen Blogs, erinnert daran, dass Kahnemans Buch wegen Replikationsproblemen als teilweise umstritten gilt.

Der Name Jev stammt von William Stanley Jevons, dem Ökonomen des 19. Jahrhunderts, der beobachtete, dass effizientere Dampfmaschinen den Kohleverbrauch insgesamt steigen ließen. Almeidas Wette ist, dass dasselbe für Intelligenz gilt: Jede Kostensenkung erschließt neue Anwendungen. The Register merkt an, dass diese Prämisse keineswegs sicher ist, da viele Menschen mit Zugang zu KI keinen Bedarf sehen oder sie aus moralischen Bedenken meiden.

Anatomie einer Entscheidung

Ein Sprachmodell ist ein Journalist: Man übergibt ihm eine Tatsache und es schreibt einen Artikel. Jev ist ein Fluglotse: Es empfängt die Lage und erzählt nichts; es weist die Landebahn zu und gibt an, mit welcher Sicherheit.

Laut Dokumentation sendet man einen Zustand—der ein Satz oder ein strukturiertes Objekt sein kann—sowie eine Reihe von Fragen aus drei Primitiv-Typen. Der Noul, ein vom Unternehmen geprägter Begriff, ist die Ja/Nein-Abfrage und liefert einen einzelnen Wahrscheinlichkeitswert zurück. In dem Beispiel auf der Noul-Dokumentationsseite vergibt das Modell bei einer Nachricht wie „Ich habe drei Mal gefragt, kann ich mit einem echten Menschen sprechen?“ 0,99 für den Wunsch nach einem menschlichen Mitarbeiter und 0,93 dafür, dass der Kunde bereits zuvor geschrieben hatte. Die Choice wählt aus verbal beschriebenen Optionen (bis zu 255) aus und weist jeder eine Wahrscheinlichkeit zu. Der Score misst auf einer geordneten Skala von 2 bis 10 beschriebenen Stufen: Auf der Score-Seite erhält ein Fehler, der den Export ausschließlich in Safari unterbricht, 0,7 auf der Stufe „Defekt mit Umgehungslösung“ und 0,3 auf „vollständige Blockade“, was einen gewichteten Durchschnittswert von 1,3 ergibt.

Choice und Score liefern auch einen Konfidenzwert von 0 bis 1, der mit Vorsicht zu interpretieren ist. Die Dokumentation definiert ihn als Berechnung über die Form der Wahrscheinlichkeitsverteilung: hoch, wenn sich die Wahrscheinlichkeit auf eine Option konzentriert, niedrig, wenn sie sich verteilt. Er gibt an, wie eindeutig die Antwort ist, nicht ob sie richtig ist. Der Noul besitzt keinen eigenen Konfidenzwert.

Alle Abfragen laufen parallel und isoliert auf demselben Zustand, weshalb das Hinzufügen weiterer Fragen die Ausführungszeit kaum verändert. Die Anleitung rät daher, komplexe Urteile in einfache Fragen zu zerlegen und sie im eigenen Code zu kombinieren, etwa indem Schweregrad, Kundenverärgerung und Berichtsqualiät gewichtet werden, um eine Priorität zu berechnen.

Was Jev nicht tut, ist genauso wichtig wie das, was es tut. Es generiert keinen Text, erklärt seine Entscheidungen nicht und kann keinen Wert außerhalb des Schemas zurückgeben: Wenn drei Antworten zulässig sind, wird eine dieser drei zurückgegeben. tabella1.jpg Kostenvergleichstabelle

Geschwindigkeit und Kosten: Die Rechnung

Hier ist der Grund, warum es so schnell läuft. Ein Sprachmodell schreibt seine Antwort Stück für Stück, und jedes Stück wartet auf das vorherige: wie ein Angestellter, der einen Bericht Zeile für Zeile verfasst, wenn Sie nur einen Stempel brauchten. Jev, erklärt TypeSafe, berechnet alle angeforderten Wahrscheinlichkeiten in einem einzigen Vorwärtslauf (forward pass). In der von The Register zitierten Benchmark-Demo auf der Website trifft die Antwort in 0,114 Sekunden ein, verglichen mit 8,566 Sekunden bei GPT-5.6 Terra; der Preis liegt bei 0,042 Dollar pro Million Input-Tokens und null für den Output.

Der Beitrag gibt Gesamtlatenzzeiten zwischen 70 und 500 Millisekunden an, gemessen nach eigenem Eingeständnis des Unternehmens von Laptops an der US-Westküste. InfoWorld weist darauf hin, dass der Dienst in einer einzigen Region gehostet wird.

Die Schlagzeilenzahlen nennen eine 193,6-mal höhere Geschwindigkeit und 444,6-mal niedrigere Kosten. Sie müssen mit dem Vorbehalt gelesen werden, den TypeSafe selbst anfügt: Sie stammen aus einem internen Test mit vier eigenen Workflows, wobei als Referenz der Durchschnitt der Antworten von GPT-6 Astra und Fable 5.1 dient und nicht eine von Menschen festgelegte Wahrheit. Das Unternehmen räumt ein, dass dies hohe Werte im Vergleich zur realen Nutzung sind. Beim Nachrechnen der öffentlichen Tabellen stellt der Entwickler Pere Pages fest, dass die beiden Spitzenwerte aus dem Vergleich mit dem langsamsten und dem teuersten Modell resultieren. Gegenüber GPT-5.6 Terra, das TypeSafe als gleichwertig ansieht, beträgt der Vorteil etwa das 25-Fache bei der Geschwindigkeit und das 76-Fache bei den Kosten—Zahlen, die mit denen von DataCamp übereinstimmen.

Was die Genauigkeit betrifft, stimmt Jev in 67,8 % der Fälle mit der Referenz überein, ähnlich wie Terra (67,9 %), fällt jedoch bei der Rechnungslesung auf 61,8 % gegenüber 74,7 % bei Terra ab. Externe Tests sind rar. Laut Pages beobachtete Mike Taylor von Every, wie Jev sechs von sieben Fehlern fand, wo Fable 5.1 alle sieben entdeckte—bei etwa 25-mal höherer Geschwindigkeit und rund 580-mal niedrigeren Kosten. TechCrunch berichtet, dass Vercel beim Ersetzen eines OpenAI-Modells in einer Befehlssicherheitsprüfung 5- bis 18-mal schnellere Antworten bei höherer Genauigkeit erzielte, während der CTO von Bryo AI bei der E-Mail-Klassifizierung Gemini etwas präziser, aber 10- bis 20-mal teurer fand. Das sind Erfahrungsberichte einzelner Entwickler.

Das am besten reproduzierbare Ergebnis betrifft die gesamte Branche. Im Test von TypeSafe verbessert sich jedes Modell, wenn dasselbe Urteil in kleine, typisierte Fragen zerlegt wird, anstatt einen einzigen Prompt zu nutzen. Laut Pages steigt Haiku 4.5 von 18,1 % auf 53,6 % Genauigkeit. Eine Erkenntnis, die auch ohne Jev gilt. confronto1.jpg Screenshot des Vergleichs zwischen Jev und GPT-5.6 Terra

Hinter den Kulissen

Was sich im Inneren von Jev befindet, gibt TypeSafe nicht preis. MarkTechPost berichtet, dass weder Gewichte noch Parameterzahlen veröffentlicht wurden. TechCrunch schreibt, es basiere auf einer Transformer-Architektur, sei aber kein Sprachmodell. Externe Beobachter vermuten ein Open-Weights-Modell als Basis, und Almeida gibt an, dass die Trainingsdaten rein synthetisch sind. Die Methode nennt sich RLCD (Reinforcement Learning for Calibrated Decisions): Während RLHF Antworten belohnt, die Menschen gefallen, und RLVR programmatisch überprüfbare Ergebnisse belohnt, soll RLCD ehrliche Wahrscheinlichkeiten belohnen—so dass das Modell, wenn es 70 % angibt, etwa in sieben von zehn Fällen recht hat.

Ein Bild hilft (rein als Veranschaulichung): ein Sprachmodell, dem der Textausgabekopf entfernt und stattdessen ein Tastenfeld aufgesetzt wurde. Darunter liegen Vermutungen. Die detaillierteste stammt von Archer Hume, der die Schnittstelle mit etwa 10.000 Anfragen testete und daraus ein Schema ableitete, bei dem der Zustand einmal gelesen wird und Fragen ihn unabhängig voneinander konsultieren, wobei die Wahrscheinlichkeiten direkt am Ende abgelesen werden. Goedecke vermutet, dass der technische Vorteil weniger tief ist als es scheint: Man kann einem gewöhnlichen Modell den Anfang der Antwort vorgeben und nur ein einzelnes ausgewähltes Stück erfragen. Mit einem kleinen Open-Source-Modell maß er eine 2- bis 3-fache Beschleunigung gegenüber klassischer strukturierter JSON-Ausgabe.

Dass die Idee nachbaubar ist, zeigen Open-Source-Projekte, die innerhalb weniger Tage entstanden sind. Jevlike trainiert ein kleines Modell, das bei gegebenem Text und einer Liste von Optionen eine Wahrscheinlichkeitsverteilung in einem einzigen Durchlauf zurückgibt. In den Experimenten des Autors erreicht es etwa 98 % bei synthetischen Menüs und bei Wikispeedia-Spielerentscheidungen 26 % mit einem kleinen eingefrorenen Modell (gegenüber etwa 8 % bei Zufallskontrollen); bei acht Optionen ist es etwa hundertmal schneller als ein kleiner Decoder, der 400 Tokens schreiben müsste. Der Autor warnt, dass er weder eine mit Jev vergleichbare Qualität nachgewiesen noch TypeSafes Methode exakt reproduziert hat. SemIf, ehemals OpenJev, verfolgt einen anderen Weg: Es liest Logits direkt aus einem offenen Modell (Qwen3.5-4B) ohne Re-Training aus. In seinem Vergleich benötigte das Schreibenlassen der Antwort durch das Modell etwa das 5,2-Fache der Zeit des direkten Auslesens. Für einen Gesamtüberblick gibt es awesome-jev mit Dutzenden Community-Projekten.

Wo es wirklich gebraucht wird

Das natürliche Einsatzgebiet sind kleine, wiederkehrende Entscheidungen, die heute teuer durch Textgenerierung bezahlt werden. Im Beispiel der Choice-Dokumentation schreibt ein Kunde, dass der Schuh zu spät und in der falschen Größe geliefert wurde, bei zwei Kreditkartenabbuchungen. Das Modell weist Retouren 0,60 und der Rechnungsstellung 0,38 zu. Der Code leitet das Ticket an die Retourenabteilung mit Kopie an die Buchhaltung weiter und veranlasst, da die Anfrage vage ist (Konfidenz 0,16), eine automatische Nachfrage beim Kunden, anstatt zu raten.

Ein zweiter wichtiger Einsatzzweck ist das Routing in Agentenketten. LangChain zeigt eine Komponente, die Jev die Anfrage lesen lässt und das günstigste Modell auswählt, das sie ausführen kann, sowie eine weitere Komponente, die Werkzeugaufrufe vor der Ausführung bewertet und risikoreiche Aktionen blockiert. Armin Ronacher, CTO bei Earendil, hebt dies gegenüber TechCrunch als natürlichen Anwendungsfall hervor, da es mit einem traditionellen Sprachmodell zu teuer wäre.

Schließlich gibt es den Spielebereich, wo Geschwindigkeit neue Möglichkeiten eröffnet. In der Doom-Demo empfängt Jev den Spielzustand als Text (nicht als Bilder) und wählt Aktionen bei etwa zehn Anfragen pro Sekunde aus, was laut Beitrag etwa 7 Dollar pro Stunde kostet. Derselbe Beitrag räumt ein, dass ein traditionelles Programm besser spielen würde: Der Punkt ist zu demonstrieren, dass ein KI-Spieler Anweisungen befolgt und unterschiedliche Zustandsdarstellungen verarbeitet. Beim Wikiracing wählt es in einem zweistufigen Verfahren aus hunderten Links aus und überwindet so das Limit von 255 Optionen.

In Bereichen, in denen eine Wahrscheinlichkeit über Menschen entscheidet—wie bei der Lebenslaufauswahl—, wird dieselbe Geschwindigkeit jedoch zum Risiko. Awesome-jev empfiehlt, Aktionen mit hoher Tragweite hinter deterministischen Regeln und menschlicher Kontrolle zu halten. Paul Chada, Mitbegründer von Doozer AI, erinnert bei InfoWorld daran, dass ein Wahrscheinlichkeitswert zeigt, wie sicher sich das Modell war, nicht warum es so entschieden hat—eine entscheidende Unterscheidung gegenüber Prüfern und Behörden. tabella2.jpg Zeitvergleichstabelle

Null Halluzinationen, aber reale Fehler

TypeSafe behauptet, dass Jev nicht halluzinieren kann. Im strengen Sinne ist das wahr, und das Unternehmen formuliert es ehrlich: Die Null ist kein Benchmark-Ergebnis, sondern ergibt sich aus der Struktur, da das Schema garantiert, dass die Ausgabe immer die erwartete Form hat. Wenn die Frage nur Ja und Nein zulässt, wird niemals ein „Vielleicht“ oder ein erfundenes Feld ausgegeben. The Register hält den Vergleich mit Sprachmodellen für ungenau und erinnert daran, dass er Fehler keineswegs ausschließt; Goedecke spricht von semantischer Ausflucht.

Stellen Sie sich vor, Sie fragen Jev bei einem Lebenslauf, ob die Erfahrung 3 bis 5 oder 6 bis 10 Jahre beträgt. Das Modell antwortet möglicherweise mit 85 % Wahrscheinlichkeit „6 bis 10 Jahre“, während ein aufmerksamer Leser 3 Jahre erkennen würde. Perfektes Schemaformat, falsche Entscheidung, hohe Konfidenz. Pages fasst es unter Berufung auf den Kommentator Anthony Maio so zusammen: Das Schema beschränkt die Form der Antwort, nicht die Richtigkeit des Urteils. Wenn man bei einer Biografie fragt, ob eine Person einen Doktortitel hat, und der Text schweigt, antwortet das Modell möglicherweise mit 65 % Wahrscheinlichkeit Ja, nur weil es rät. Abhilfe schafft das Design von Schemata mit expliziten Auswegen—indem man „Sonstiges“ oder „Keines der genannten“ zu Auswahloptionen hinzufügt. Bei Ja/Nein hilft das nicht: Ein Wert von 0,5 bei einem Noul bedeutet keine Neutralität, sondern besagt nur, dass Ja und Nein als gleich wahrscheinlich bewertet werden.

Die entscheidende Frage ist, ob die Wahrscheinlichkeiten gut kalibriert sind. Laut Pages hat TypeSafe keine Kalibrierungskurven veröffentlicht. Es gibt einen unabhängigen Versuch (von einem einzelnen Entwickler, einem einzelnen Konto, einer einzelnen Region): Hume berechnete bei 1.200 MMLU-Fragen einen erwarteten Kalibrierungsfehler (ECE) von 0,031, was solide ist. Bei eigens generierten Matheaufgaben lag das Modell jedoch in 56 % der Fälle richtig, bei einer angegebenen durchschnittlichen Wahrscheinlichkeit von 35 %. Zudem verschoben sich beim Umkehren der Reihenfolge der Optionen die Wahrscheinlichkeiten (z. B. von 0,84–0,89 auf 0,93–0,96), was bedeutet, dass ein Schwellenwert von 0,9 aus Gründen ausgelöst werden kann oder nicht, die nichts mit dem Inhalt zu tun haben.

In Lucas Popes Videospiel Papers, Please, in dem man in einer endlosen Schlange „genehmigt“ oder „abgelehnt“ auf Pässe stempelt, besteht die Schwierigkeit nicht im Stempeln selbst, sondern darin zu wissen, wann man den Dokumenten trauen kann. Das Anpassen der Schwellenwerte bei Jev ist genau diese Arbeit: Jeder Stempel passt zum Schema, aber nicht jeder Stempel ist korrekt.

Skeptiker, Rivalen und offene Fragen

Wer bereits ein Sprachmodell mit strukturierter Ausgabe nutzt, fragt sich vielleicht, was sich wirklich ändert. Pages vergleicht drei Wege. Ein klassischer Klassifikator vom Typ BERT ist extrem schnell, benötigt aber tausende gelabelte Beispiele und muss für jede Aufgabe neu trainiert werden. Ein Sprachmodell mit JSON-Schema ist flexibel, aber langsam und teuer, und seine angegebenen Wahrscheinlichkeiten sind unzuverlässig. Jev verspricht die Flexibilität des zweiten Weges mit der Geschwindigkeit des ersten, kombiniert mit nativen Wahrscheinlichkeiten, deren tatsächliche Kalibrierung noch auf breiter Front zu überprüfen bleibt.

Wer profitiert davon? Von InfoWorld befragte Analysten sagen voraus, dass Jev Generalistenmodelle ergänzen wird—wobei letztere offenes Reasoning, Zusammenfassungen und Interaktion übernehmen, während System-1-Modellen das Routing, Scoring, Auditing und Konformitätsprüfungen überlassen werden. Die Rechnung ist jedoch nicht nur technischer Natur. Stephanie Walter von HyperFrame Research gibt zu bedenken, dass Fragen, Auswahloptionen und Schwellenwerte vorab definiert werden müssen, während Advait Patel von Broadcom an die Risiken eines jungen Anbieters erinnert: Sicherheit, Datensouveränität und Herstellerbindung. TypeSafe räumt ein, nicht beweisen zu können, dass die Preise nicht subventioniert sind. Ronacher sagt voraus, dass Konkurrenten auftauchen werden, nachdem das Muster nun klar ist, und TechCrunch berichtet, dass das Unternehmen wegen der enormen Nachfrage kurzzeitig API-Ausfälle hatte.

Es bleiben offene Fragen, die nur die Zeit und unabhängige Tests klären können: Halten die Wahrscheinlichkeiten ihre Kalibrierung außerhalb der vier Test-Workflows des Unternehmens? Wie schneidet das Modell im Vergleich zu menschlichen Referenztests ab? Wird ein technisches Paper zu RLCD erscheinen? Wird der Dienst über eine einzelne Region hinaus verfügbar sein und zu welchem Preis? Und wenn Jevons recht hatte: Wer wird das System überwachen, wenn automatisierte Entscheidungen Millionen pro Tag erreichen?

Weniger Gerede, mehr ausführbare Entscheidungen: Jev ist nicht einfach ein weiteres Modell, sondern eine andere Art, mit Software zu interagieren. Linthicum stellt sich schnelle Reflexmodelle neben bedächtig denkenden Sprachmodellen vor; Almeida träumt von allgegenwärtiger intelligenter Software, so selbstverständlich wie das frühe Web. Wenn sie recht behalten, wird das künftige KI-Ökosystem ein Orchester kleiner Spezialisten sein, geleitet von einem Modell, das sprechen kann. Wenn sie unrecht haben, bleibt dennoch eine wertvolle Lerneffekt: komplexe Urteile in einfache Fragen zu zerlegen und sich stets zu fragen, wie sehr man der Antwort vertrauen kann.


Datenstand: 20. September 2026. Aussagen zu Geschwindigkeit, Kosten und Genauigkeit stammen von TypeSafe oder einzelnen Entwicklern; es existieren derzeit keine umfassenden unabhängigen Benchmarks mit Peer-Review.