Notizie IA Logo

AITalk

Actualités et analyses sur l'intelligence artificielle

Jev ne chatte pas, il décide

Generative AIResearchApplications

jev.jpg

Quelques jours seulement après son lancement, un modèle qui n'écrit pas un seul mot oblige à se demander à quoi sert réellement l'intelligence artificielle. Les modèles sont surhumains en conversation depuis des années, alors où se trouve l'automatisation ? C'est la question par laquelle Diogo Almeida ouvre le post de lancement de Jev, publié le 15 septembre 2026, affirmant la poursuivre depuis quatre ans. Il dirige TypeSafe, une jeune entreprise de San Francisco qui, selon The Register et TS2, a levé 40 millions de dollars lors d'un tour de table mené par DCVC.

Son parcours constitue le premier argument en sa faveur. Almeida figure parmi les auteurs principaux d'InstructGPT, la recherche fondatrice d'OpenAI sur l'apprentissage à partir de retours humains, et TechCrunch le présente comme l'un des inventeurs du RLHF. Une précision s'impose ici : l'idée d'entraîner un système sur les préférences humaines a été formalisée dans un article de 2017 signé par six auteurs, et son nom n'y figure pas. Il est plus prudent de dire qu'il a contribué à l'intégrer au sein des chatbots, comme semble l'indiquer DCVC dans le communiqué rapporté par TS2.

Le paradoxe est posé : des chatbots surhumains, mais une automatisation toujours lente et coûteuse. La réponse de TypeSafe prend la forme d'un modèle qui renonce totalement à la génération de texte. Il ne converse pas, n'explique pas, ne raconte pas d'histoires. Comme le scribe Bartleby de Melville, il préférerait ne pas le faire. Mais il accomplit une chose : il décide.

La rédaction et l'interrupteur

Pour allumer la lumière d'une pièce, vous ne devriez pas avoir à rédiger au préalable un essai expliquant qu'il fait nuit, pour ensuite le remettre à quelqu'un qui le lit et décide d'appuyer ou non sur l'interrupteur. L'automatisation avec un modèle linguistique fonctionne aujourd'hui de manière très similaire. Le programme transmet au modèle un état non structuré, par exemple l'historique de discussion avec un client ; le modèle génère du texte mot après mot ; un second fragment de code lit ce texte et en extrait la décision.

Le coût se manifeste sur trois plans. Le premier est la vitesse : selon un organisme indépendant de mesure cité par TypeSafe, les modèles de pointe répondent dans un intervalle de 3 à 329 secondes—acceptable dans une conversation humaine, mais très lourd au sein d'un programme. Le second est le prix : le post signale de 0,20 à 10 dollars par million de jetons en entrée, l'entrée étant environ cinq fois moins chère que la sortie. Le troisième réside dans la friction d'ingénierie. David Linthicum, consultant interrogé par InfoWorld, compare l'usage d'un modèle généraliste pour un simple oui ou non à la mobilisation de tout un bus de services d'entreprise pour une simple question de routage, et rappelle les empilements d'instructions, de schémas, de validations, de tentatives répétées et de garde-fous que les ingénieurs construisent autour du texte libre.

S'ajoute à cela la question de la confiance. Un modèle qui accomplit correctement une tâche dans 95 % des cas sans indiquer quels sont les 5 % restants, soutient TypeSafe, n'automatise pas réellement cette tâche : vous savez qu'il se trompe, mais pas quand. LangChain ajoute que le tool calling et les sorties structurées ont apporté une aide, mais que la boucle des agents reste lente et coûteuse car chaque décision exige une nouvelle invocation du modèle.

Penser vite, penser lentement

TypeSafe a baptisé sa nouvelle catégorie System One Models en hommage à l'ouvrage Système 1 / Système 2 : Les deux vitesses de la pensée de Daniel Kahneman, où le Système 1 représente la pensée rapide et intuitive, et le Système 2 la pensée lente et délibérative. Dans le parallèle établi par l'entreprise, les modèles linguistiques traditionnels se situent du côté lent ; Jev entend constituer le miroir rapide. Un état non structuré entre ; des décisions typées assorties d'une probabilité sortent, sans passer par la moindre phrase. Le post le résume comme un appel de fonction propulsé par une intelligence de frontière.

La métaphore comporte des limites. La foire aux questions du post reconnaît que « Système 1 » évoque l'idée d'erreur, et promet d'expliquer ultérieurement pourquoi ces modèles peuvent s'avérer plus fiables. Sean Goedecke, auteur d'un blog technique, rappelle que l'ouvrage de Kahneman est considéré comme partiellement contesté en raison de problèmes de réplicabilité.

Le nom Jev provient quant à lui de William Stanley Jevons, l'économiste du XIXe siècle ayant observé que des machines à vapeur plus efficientes augmentaient en réalité la consommation globale de charbon. Le pari d'Almeida est que la même règle s'applique à l'intelligence : chaque réduction de coût ouvre de nouveaux usages. The Register observe que cette prémisse n'est pas garantie, de nombreuses personnes disposant d'un accès à l'IA n'en ressentant pas le besoin ou l'évitant pour des raisons morales.

Anatomie d'une décision

Un modèle linguistique est un journaliste : vous lui soumettez un fait et il rédige un article. Jev est un contrôleur aérien : il reçoit la situation et ne raconte rien ; il indique la piste et le niveau de certitude associé.

Selon la documentation, vous soumettez un état—qui peut être une phrase ou un objet structuré—ainsi qu'une série de questions réparties selon trois types primitifs. Le Noul, terme créé par l'entreprise, est une requête binaire oui/non renvoyant une probabilité unique. Dans l'exemple de la page dédiée au Noul, pour un message du type « je l'ai demandé trois fois, puis-je parler à une vraie personne ? », il renvoie 0,99 pour la demande d'un conseiller humain et 0,93 pour le fait que le client a déjà écrit précédemment. La Choice sélectionne parmi des options décrites textuellement (jusqu'à 255), en attribuant une probabilité à chacune. Le Score évalue sur une échelle ordonnée de 2 à 10 niveaux décrits : sur la page dédiée au Score, un bogue bloquant l'exportation uniquement sur Safari reçoit 0,7 sur le niveau « défaut avec solution de contournement » et 0,3 sur « blocage total », soit un score moyen pondéré de 1,3.

Choice et Score restituent également un indice de confiance entre 0 et 1, qu'il convient d'interpréter avec précaution. La documentation le définit comme un calcul sur la forme de la distribution de probabilité : élevé si la probabilité se concentre sur une option, faible si elle est dispersée. Il indique à quel point la réponse est tranchée, et non si elle est exacte. Le Noul ne possède pas de score de confiance propre.

Toutes les requêtes s'exécutent en parallèle et de façon isolée sur le même état, de sorte que l'ajout de questions modifie à peine la vitesse d'exécution. La documentation recommande donc de décomposer les jugements complexes en questions simples et de les combiner dans son propre code, en pondérant par exemple la gravité, la frustration du client et la qualité du rapport pour obtenir une priorité.

Ce que Jev ne fait pas est tout aussi essentiel que ce qu'il accomplit. Il ne génère pas de texte, n'explique pas ses choix et ne peut pas renvoyer une valeur hors schéma : si trois réponses sont valides, l'une de ces trois ressortira. tabella1.jpg Tableau de comparaison des coûts

Vitesse et coûts : le détail des calculs

Voici pourquoi il fonctionne rapidement. Un modèle linguistique rédige sa réponse morceau par morceau, chaque morceau attendant le précédent : tel un employé rédigeant un rapport ligne par ligne quand vous aviez seulement besoin d'un coup de tampon. Jev, explique TypeSafe, calcule toutes les probabilités demandées en une seule passe avant (forward pass). Dans la démonstration sur le site citée par The Register, la réponse arrive en 0,114 seconde contre 8,566 secondes pour GPT-5.6 Terra ; le prix est de 0,042 dollar par million de jetons en entrée et nul en sortie.

Le post annonce des temps de latence globaux entre 70 et 500 millisecondes, mesurés de l'aveu même de l'entreprise depuis des ordinateurs portables sur la côte ouest des États-Unis. InfoWorld précise que le service est hébergé dans une région unique.

Les chiffres mis en avant annoncent une vitesse 193,6 fois supérieure et un coût 444,6 fois inférieur. Ils doivent être lus avec l'avertissement que TypeSafe y joint : ils proviennent d'un test interne sur quatre flux de travail élaborés par ses équipes, en prenant comme référence la moyenne des réponses de GPT-6 Astra et Fable 5.1 plutôt qu'une vérité établie par des humains, et l'entreprise reconnaît qu'il s'agit d'estimations hautes par rapport à l'usage réel. En recomptant sur les tableaux publics, le développeur Pere Pages constate que ces deux pics découlent de la comparaison avec le modèle le plus lent et le plus cher. Face à GPT-5.6 Terra, que TypeSafe considère comme un modèle équivalent, l'avantage est d'environ 25 fois en vitesse et 76 fois en coût, des chiffres qui rejoignent ceux de DataCamp.

En matière de précision, Jev concorde avec le modèle de référence dans 67,8 % des cas, tout comme Terra (67,9 %), bien que sur l'analyse de factures il descende à 61,8 % contre 74,7 % pour Terra. Les tests externes restent rares. Selon Pages, Mike Taylor d'Every a observé Jev détecter six défauts sur sept là où Fable 5.1 les repérait tous, avec une vitesse environ 25 fois plus rapide et un coût environ 580 fois inférieur. TechCrunch rapporte que Vercel, en remplaçant un modèle d'OpenAI lors d'un contrôle de sécurité des commandes, a obtenu des réponses 5 à 18 fois plus rapides et plus précises, tandis que le directeur technique de Bryo AI a trouvé Gemini légèrement plus précis pour la classification de courriels, mais 10 à 20 fois plus cher. Il s'agit de témoignages de développeurs individuels.

Le résultat le plus reproductible concerne l'ensemble du secteur. Dans le benchmark de TypeSafe, chaque modèle s'améliore lorsque le même jugement est décomposé en petites questions typées au lieu d'un prompt unique ; selon Pages, Haiku 4.5 passe de 18,1 % à 53,6 % de précision. Une leçon valable même sans utiliser Jev. confronto1.jpg Capture d'écran de la comparaison entre Jev et GPT-5.6 Terra

Dans les coulisses

TypeSafe ne révèle pas ce que contient le modèle Jev. MarkTechPost indique que ni les poids ni le nombre de paramètres n'ont été publiés. TechCrunch écrit qu'il repose sur une architecture transformer sans être un modèle linguistique, que des observateurs externes suspectent un modèle à poids open source à la base, et qu'Almeida affirme que les données d'entraînement sont exclusivement synthétiques. La méthode s'appelle RLCD (apprentissage par renforcement pour décisions calibrées) : là où le RLHF récompense les réponses appréciées par les humains et le RLVR celles vérifiables par un programme, le RLCD entend récompenser des probabilités honnêtes, de sorte que lorsque le modèle annonce 70 %, il ait raison environ sept fois sur dix.

Une analogie peut aider (à prendre comme simple illustration) : un modèle linguistique dont on aurait retiré la tête de génération de texte pour la remplacer par un panneau de boutons. Sous la surface, il s'agit de conjectures. L'analyse la plus détaillée provient d'Archer Hume, qui a sondé l'interface au moyen d'environ 10 000 requêtes et en a déduit le schéma d'un état lu en une seule passe et de questions le consultant de manière indépendante, avec les probabilités lues directement en sortie. Goedecke soupçonne que l'avantage technique est moins profond qu'il n'y paraît : on peut fournir à un modèle classique le début de la réponse déjà rédigé et lui demander uniquement les probabilités de jetons pour les choix proposés. Avec un petit modèle open source, il a mesuré une accélération de 2 à 3 fois par rapport à la génération de sortie structurée classique en JSON.

Des projets open source ont émergé en quelques jours. Jevlike entraîne un petit modèle qui, à partir d'un texte et d'une liste d'options, renvoie une distribution de probabilités en une seule passe. Dans les expériences de l'auteur, il atteint environ 98 % sur des menus synthétiques et 26 % sur les choix de joueurs de Wikispeedia (avec un petit modèle gelé, contre environ 8 % pour des contrôles aléatoires) ; pour huit options, il s'avère environ cent fois plus rapide qu'un petit décodeur devant générer 400 jetons. L'auteur précise ne pas avoir démontré une qualité égale à Jev ni reproduit la méthode de TypeSafe. SemIf, anciennement OpenJev, emprunte une autre voie : lire les probabilités directement depuis un modèle ouvert (Qwen3.5-4B) sans réentraînement ; dans son benchmark, faire rédiger la réponse par le modèle a demandé environ 5,2 fois le temps de la lecture directe. Pour une vue d'ensemble, awesome-jev recense des dizaines de projets communautaires.

Les cas d'usage réels

Son domaine naturel réside dans les décisions petites et répétitives aujourd'hui payées au prix d'une génération de texte. Dans l'exemple de la documentation de Choice, un client écrit que les chaussures sont arrivées en retard et dans la mauvaise pointure, avec deux débits sur sa carte. Le modèle attribue 0,60 aux retours et 0,38 à la facturation ; le code achemine le ticket vers les retours avec copie à la facturation et, la demande étant vague (confiance de 0,16), déclenche une demande d'éclaircissement automatique auprès du client au lieu de deviner.

Un second usage majeur concerne le routage dans les chaînes d'agents. LangChain présente un composant permettant à Jev de lire la requête et de sélectionner le modèle le moins cher capable de l'exécuter, ainsi qu'un autre composant évaluant les appels d'outils avant exécution afin de bloquer les actions risquées. Armin Ronacher, directeur technique d'Earendil, le souligne auprès de TechCrunch comme un cas d'usage évident, car avec un modèle linguistique traditionnel, le coût serait prohibitif.

Il y a enfin le jeu vidéo, où la vitesse modifie les possibilités. Dans la démonstration sur Doom, Jev reçoit l'état de la partie décrit sous forme de texte (et non d'images) et sélectionne les actions à raison d'environ dix requêtes par seconde, pour un coût estimé par le post à environ 7 dollars par heure. Le post reconnaît qu'un programme traditionnel jouerait mieux : l'objectif est de démontrer qu'un joueur IA peut suivre des instructions et gérer des représentations variées de l'état du jeu. Dans le wikiracing, il choisit parmi des centaines de liens au moyen d'une procédure en deux étapes dépassant la limite des 255 options.

Dans les domaines où une probabilité a un impact sur une personne—comme le tri de CV—cette même vitesse devient un risque. Awesome-jev recommande de maintenir les actions à fort impact derrière des règles déterministes et un contrôle humain, tandis que Paul Chada, cofondateur de Doozer AI, rappelle dans InfoWorld qu'une probabilité indique à quel point le modèle était sûr, et non pourquoi il a pris cette décision—une nuance essentielle pour les auditeurs et autorités. tabella2.jpg Tableau de comparaison des temps

Zéro hallucination, mais des erreurs possibles

TypeSafe affirme que Jev ne peut pas halluciner. Au sens strict, cela est exact, et l'entreprise le formule en toute honnêteté : le zéro n'est pas un résultat de benchmark mais découle de la structure même du système, le schéma garantissant que la sortie respecte toujours la forme attendue. Si la question admet uniquement oui ou non, il ne sortira jamais « peut-être » ni une clé inventée. The Register juge la comparaison avec les modèles linguistiques peu rigoureuse et rappelle qu'elle n'exclut pas l'erreur ; Goedecke parle d'une esquive sémantique.

Imaginez demander à Jev, au sujet d'un CV, si l'expérience est de 3 à 5 ans ou de 6 à 10 ans. Le modèle peut répondre « de 6 à 10 ans » avec une probabilité de 85 % alors qu'un lecteur attentif verrait 3 ans. Le format du schéma est parfait, la décision est erronée, et la confiance est élevée. Pages, citant le commentateur Anthony Maio, le résume ainsi : le schéma contraint la forme de la réponse, non la justesse du jugement. De même, si l'on demande si une biographie mentionne un doctorat alors que le texte est muet, le modèle peut répondre oui à 65 % par simple devinette. La solution consiste à concevoir des schémas prévoyant une issue explicite—en ajoutant « autre » ou « aucun des choix précédents » aux listes. Pour les réponses binationale oui/non, cela ne s'applique pas : un 0,5 sur un Noul n'indique pas une neutralité, mais signifie simplement que le oui et le non sont évalués comme équiprobables.

La vraie question est de savoir si les probabilités sont bien calibrées. Selon Pages, TypeSafe n'a pas publié de courbes de calibration. Un essai indépendant existe (mené par un seul développeur, un seul compte, une seule région) : Hume a calculé sur 1 200 questions du test MMLU une erreur de calibration attendue (ECE) de 0,031, ce qui est solide. Cependant, sur des problèmes de mathématiques générés sur mesure, le modèle a répondu correctement 56 % du temps avec una probabilité moyenne annoncée de 35 %. De plus, en inversant l'ordre des options, les probabilités variaient (par exemple de 0,84–0,89 à 0,93–0,96), ce qui signifie qu'un seuil fixé à 0,9 peut se déclencher ou non pour des raisons étrangères au contenu.

Dans Papers, Please, le jeu vidéo de Lucas Pope où l'on appose le tampon « admis » ou « refusé » sur les passeports d'une file ininterrompue, la difficulté ne réside pas dans l'action de tamponner, mais dans le fait de savoir quand faire confiance aux documents. Régler les seuils de Jev relève de ce même travail : chaque tampon est conforme au schéma, mais tous ne sont pas justes.

Sceptiques, rivaux et questions ouvertes

Ceux qui utilisent déjà un modèle linguistique avec sortie structurée peuvent se demander ce qui change réellement. Pages compare trois approches. Un classifieur classique, type BERT, est extrêmement rapide mais nécessite des milliers d'exemples annotés et doit être réentraîné pour chaque tâche. Un modèle linguistique avec schéma JSON est flexible mais lent et coûteux, et ses probabilités affichées ne sont pas fiables. Jev promet la flexibilité du second avec la rapidité du premier, assortie de probabilités natives dont la calibration reste à vérifier à grande échelle.

À qui cela profite-t-il ? Les analystes interrogés par InfoWorld prévoient que Jev complétera les modèles généralistes—ces derniers conservant le raisonnement ouvert, la synthèse et l'interaction, tout en confiant aux modèles du Système 1 le routage, le scoring, l'audit et les contrôles de conformité. Mais l'équation n'est pas uniquement technique. Stephanie Walter, de HyperFrame Research, souligne que les questions, les choix et les seuils doivent être définis au préalable, tandis qu'Advait Patel, de Broadcom, rappelle les risques liés à un jeune fournisseur : sécurité, résidence des données et dépendance. TypeSafe reconnaît ne pas pouvoir prouver que sa tarification n'est pas subventionnée. Ronacher prédit que des concurrents émergeront maintenant que le modèle est clair, tandis que TechCrunch rapporte que l'entreprise a subi de brèves interruptions d'API en raison d'une forte demande au lancement.

Des questions restent ouvertes et seuls le temps et des tests indépendants pourront y répondre : Les probabilités conservent-elles leur calibration en dehors des quatre flux de test de l'entreprise ? Quels sont les résultats face à des benchmarks évalués par des humains ? Un papier technique sur le RLCD sera-t-il publié ? Le service sera-t-il déployé sur plusieurs régions, et à quel prix ? Et si Jevons avait raison, qui contrôlera le système lorsque les décisions automatisées se compteront par millions chaque jour ?

Moins de discours, plus de décisions exécutables : Jev n'est pas simplement un modèle supplémentaire, mais une manière différente d'interagir avec le logiciel. Linthicum imagine des modèles réflexes opérant aux côtés de modèles à pensée lente ; Almeida rêve d'un logiciel intelligent omniprésent, aussi naturel que le Web des débuts. S'ils ont raison, le futur écosystème sera une orchestre de petits spécialistes dirigés par un modèle sachant parler. S'ils ont tort, la leçon principale restera précieuse : décomposer les jugements complexes en questions simples, et toujours se demander dans quelle mesure on peut faire confiance à la réponse.


Données à jour au 20 septembre 2026. Les affirmations relatives à la vitesse, au coût et à la précision émanent de TypeSafe ou de développeurs individuels ; il n'existe pas à ce jour de benchmarks indépendants globaux ou revus par des pairs.