Jev no chatea, decide

A pocos días de su lanzamiento, un modelo que no escribe una sola palabra nos obliga a preguntarnos para qué sirve realmente la inteligencia artificial. Los modelos han sido sobrehumanos en el chat durante años, así que ¿dónde está la automatización? Es la pregunta con la que Diogo Almeida abre la publicación de lanzamiento de Jev, publicada el 15 de septiembre de 2026, y afirma llevar persiguiéndola cuatro años. Dirige TypeSafe, una joven empresa de San Francisco que, según The Register y TS2, ha recaudado 40 millones de dólares en una ronda liderada por DCVC.
Su trayectoria es el primer argumento a su favor. Almeida figura entre los autores principales de InstructGPT, el trabajo fundamental de OpenAI sobre el entrenamiento con retroalimentación humana, y TechCrunch lo presenta como uno de los inventores del RLHF. Aquí hace falta precisión: la idea de entrenar un sistema según las preferencias humanas se formalizó en un artículo de 2017 firmado por seis autores, y su nombre no figura entre ellos. Es más prudente decir que contribuyó a llevarla al ámbito de los chatbots, como parece dar a entender también DCVC en el comunicado recogido por TS2.
La paradoja está servida: chatbots sobrehumanos, pero la automatización sigue siendo lenta y costosa. La respuesta de TypeSafe es un modelo que renuncia por completo a la generación de texto. No conversa, no explica, no cuenta historias. Como el escribiente Bartleby de Melville, preferiría no hacerlo. Pero hace una cosa: decide.
La redacción y el interruptor
Para encender la luz de una habitación, no deberíais tener que escribir primero una redacción explicando que está a oscuras, para luego entregársela a alguien que la lea y decida si presiona el interruptor. La automatización con un modelo lingüístico funciona hoy de forma muy parecida. El programa pasa al modelo un estado no estructurado, por ejemplo la conversación con un cliente; el modelo genera texto palabra por palabra; un segundo fragmento de código lee ese texto y extrae de él la decisión.
El coste se aprecia en tres aspectos. El primero es el tiempo: según una plataforma independiente de medición citada por TypeSafe, los modelos insignia responden en un intervalo de 3 a 329 segundos, algo aceptable en un chat pero pesado dentro de un programa. El segundo es el precio: la publicación señala de 0,20 a 10 dólares por millón de tokens de entrada, siendo la salida unas cinco veces más cara. El tercero es la fricción de ingeniería. David Linthicum, consultor entrevistado por InfoWorld, compara el uso de un modelo generalista para una simple respuesta afirmativa o negativa con movilizar todo un autobús de servicios empresariales para una consulta de enrutamiento, y recuerda las capas de instrucciones, esquemas, validaciones, reintentos y barreras que los técnicos construyen alrededor del texto libre.
Está además la confianza. Un modelo que realiza bien una tarea en el 95% de los casos pero no indica cuáles son los otros, sostiene TypeSafe, no automatiza realmente esa tarea: sabéis que se equivoca, pero no cuándo. LangChain añade que el tool calling y las salidas estructuradas han ayudado, pero el ciclo de los agentes sigue siendo lento y costoso porque cada decisión requiere otra llamada al modelo.
Pensar rápido, pensar despacio
TypeSafe ha bautizado su nueva categoría como System One Models en homenaje a Pensar rápido, pensar despacio de Daniel Kahneman, donde el Sistema 1 es el pensamiento rápido e intuitivo y el Sistema 2 es el lento y deliberativo. En el juego de espejos de la empresa, los modelos lingüísticos tradicionales se sitúan en el lado lento; Jev pretende ser su reflejo rápido. Entra un estado no estructurado; salen decisiones tipadas con una probabilidad, sin pasar por una sola frase. La publicación lo resume como una llamada a una función impulsada por inteligencia de frontera.
La metáfora tiene un precio. Las preguntas frecuentes de la propia publicación admiten que «Sistema 1» evoca la idea de propenso al error, y prometen explicar más adelante por qué estos modelos pueden ser más fiables. Sean Goedecke, autor de un blog técnico, recuerda que el libro de Kahneman se considera parcialmente desacreditado por problemas de replicación.
El nombre Jev procede de William Stanley Jevons, el economista del siglo XIX que observó cómo los motores de vapor más eficientes aumentaban en realidad el consumo total de carbón. La apuesta de Almeida es que lo mismo se aplica a la inteligencia: cada reducción de costes abre nuevos usos. The Register señala que esta premisa no está garantizada, ya que muchas personas con acceso a la IA no sienten la necesidad de usarla o la evitan por objeciones morales.
Anatomía de una decisión
Un modelo lingüístico es un periodista: le entregáis un hecho y escribe un artículo. Jev es un controlador aéreo: recibe la situación y no narra nada, indica la pista y con qué nivel de certeza.
Según la documentación, se envía un estado —que puede ser una frase o un objeto estructurado— y una serie de preguntas de tres tipos. El Noul, término acuñado por la empresa, es la consulta de sí o no y devuelve una sola probabilidad. En el ejemplo de la página dedicada al Noul, ante un mensaje del tipo «lo he pedido tres veces, ¿puedo hablar con una persona real?», asigna 0,99 a la solicitud de un operador humano y 0,93 al hecho de que el cliente ya había escrito anteriormente. La Choice selecciona entre opciones descritas con palabras (hasta 255) y asigna una probabilidad a cada una. El Score mide en una escala ordenada de 2 a 10 niveles descritos: en la página de Score, un error que rompe la exportación únicamente en Safari recibe 0,7 en el nivel «defecto con solución alternativa» y 0,3 en «bloqueo total», obteniendo una puntuación media ponderada de 1,3.
Choice y Score aportan también una confianza de 0 a 1, que debe interpretarse con cautela. La documentación la define como un cálculo sobre la forma de la distribución de probabilidad: alta si la probabilidad se concentra en una opción, baja si se dispersa. Indica lo contundente que es la respuesta, no si es correcta. El Noul no tiene una confianza propia.
Todas las consultas se ejecutan en paralelo e insularidad sobre el mismo estado, por lo que añadir más preguntas penas afecta a los tiempos. Por ello, la guía aconseja fragmentar los juicios complejos en preguntas sencillas y combinarlas en vuestro propio código, ponderando por ejemplo la gravedad, la irritación del cliente y la calidad del informe para obtener una prioridad.
Lo que no hace importa tanto como lo que hace. No genera texto, no explica sus elecciones y no puede devolver un valor fuera de esquema: si las respuestas admitidas son tres, saldrá una de esas tres.

Velocidad y costes: las cuentas
He aquí por qué funciona tan rápido. Un modelo lingüístico escribe su respuesta fragmento a fragmento y cada fragmento espera al anterior: como el empleado que redacta un informe línea por línea cuando vosotras solo necesitabais un sello. Jev, explica TypeSafe, calcula todas las probabilidades solicitadas en un solo paso hacia adelante (forward pass). En la demostración de su sitio web citada por The Register, la respuesta llega en 0,114 segundos frente a los 8,566 de GPT-5.6 Terra; el precio es de 0,042 dólares por millón de tokens de entrada y nada por la salida.
La publicación declara tiempos totales de latencia entre 70 y 500 milisegundos, medidos según reconoce la empresa desde portátiles en la costa oeste de los Estados Unidos. InfoWorld precisa que el servicio está alojado en una única región.
Las cifras de portada afirman ser 193,6 veces más rápido y 444,6 veces más económico. Deben leerse con la advertencia que la propia TypeSafe adjunta: proceden de una prueba interna sobre cuatro flujos de trabajo elaborados por su equipo, utilizando como referencia la media de respuestas de GPT-6 Astra y Fable 5.1 y no una verdad absoluta establecida por personas, y la empresa considera que son valores elevados en comparación con el uso real. Rehaciendo los cálculos sobre las tablas públicas, el desarrollador Pere Pages halla que esos dos picos nacen de la comparación con el modelo más lento y con el más caro. Frente a GPT-5.6 Terra, al que TypeSafe considera un homólogo equivalente, la ventaja es de unas 25 veces en velocidad y 76 en coste, cifras que coinciden con las de DataCamp.
En cuanto a la precisión, Jev coincide con la referencia en el 67,8% de los casos, al igual que Terra (67,9%), aunque en la lectura de facturas desciende al 61,8% frente al 74,7% de Terra. Las pruebas externas son escasas. Según Pages, Mike Taylor de Every observó a Jev detectar seis defectos de siete donde Fable 5.1 los encontraba todos, con una velocidad unas 25 veces mayor y un coste unas 580 veces menor. TechCrunch informa que Vercel, al sustituir un modelo de OpenAI en un control de seguridad de comandos, obtuvo respuestas de 5 a 18 veces más rápidas y más precisas, mientras que el director técnico de Bryo AI, en la clasificación de correos, halló a Gemini un poco más preciso pero de 10 a 20 veces más caro. Son testimonios de desarrolladores individuales.
El resultado más reproducible atañe a toda la industria. En la prueba de TypeSafe, todos los modelos mejoran si el mismo juicio se descompone en pequeñas preguntas tipadas en lugar de un único prompt; según Pages, Haiku 4.5 sube del 18,1% al 53,6% de precisión. Una lección válida incluso sin usar Jev.

Detrás del telón
Qué hay exactamente dentro de Jev es algo que TypeSafe no revela. MarkTechPost señala que no se han publicado ni los pesos ni el número de parámetros. TechCrunch escribe que está basado en una arquitectura transformer pero no es un modelo lingüístico, que los observadores externos sospechan de un modelo de pesos abiertos en la base y que, según Almeida, los datos de entrenamiento son puramente sintéticos. El método se denomina RLCD (aprendizaje por refuerzo para decisiones calibradas): mientras que el RLHF premia las respuestas que agradan a los humanos y el RLVR las verificables por un programa, el RLCD pretende premiar probabilidades honestas, tales que si el modelo indica un 70%, tenga razón unas siete veces de cada diez.
Una analogía ayuda (tomada meramente como imagen): un modelo lingüístico al que le han retirado la salida de texto y le han colocado un panel de botones. Debajo hay conjeturas. La más detallada procede de Archer Hume, quien sondeó la interfaz con unas 10.000 peticiones y dedujo un esquema de un estado leído una sola vez y preguntas que lo consultan de forma independiente, con las probabilidades leídas directamente en la salida. Goedecke sospecha que la ventaja técnica es menos profunda de lo que parece: se puede proporcionar a un modelo común el inicio de la respuesta ya escrito y pedirle un solo fragmento elegido entre las opciones. Con un modelo pequeño, midió una aceleración de dos a tres veces respecto a la salida estructurada clásica.
Que la idea es replicable lo demuestran los proyectos abiertos nacidos en pocos días. Jevlike entrena un modelo pequeño que, dados un texto y una lista de opciones, devuelve una distribución de probabilidades en un solo paso. En los experimentos del autor alcanza un ~98% en menús sintéticos y, sobre las elecciones de jugadores de Wikispeedia, un 26% con un modelo pequeño congelado (frente al ~8% de los controles aleatorios); para ocho opciones es unas cien veces más rápido que un pequeño decodificador obligado a escribir 400 tokens. El autor advierte de que no ha demostrado una calidad equivalente a Jev ni ha reproducido el método de TypeSafe. SemIf, antes OpenJev, sigue otra vía: lee las probabilidades directamente de un modelo abierto, Qwen3.5-4B, sin reentrenarlo; en su comparativa, hacer escribir la respuesta al modelo requirió unas 5,2 veces el tiempo de la lectura directa. Para una visión global, awesome-jev recopila decenas de proyectos comunitarios.
Dónde resulta realmente útil
Su terreno natural son las decisiones pequeñas y repetitivas que hoy se pagan a precio de relato. En el ejemplo de la documentación de Choice, un cliente escribe que los zapatos llegaron con retraso y en la talla equivocada, con dos cargos en la tarjeta. El modelo asigna 0,60 a devoluciones y 0,38 a facturación; el código envía el tique a devoluciones con copia a facturación y, como la solicitud es vaga (confianza 0,16), hace preguntar al cliente qué desea en lugar de adivinar.
Un segundo uso importante es el enrutamiento en cadenas de agentes. LangChain muestra un componente que hace leer la petición a Jev y elige el modelo menos costoso capaz de ejecutarla, y otro que evalúa las llamadas a herramientas antes de ejecutarlas, bloqueando las arriesgadas. Armin Ronacher, director técnico de Earendil, lo señala en TechCrunch como un caso natural, porque con un modelo lingüístico tradicional sería demasiado caro.
Luego están los juegos, donde la velocidad cambia las posibilidades. En la demostración sobre Doom, Jev recibe el estado de la partida descrito en texto (no en imágenes) y elige las acciones a unas diez peticiones por segundo, con un coste estimado en la publicación de unos 7 dólares por hora. La misma publicación admite que un programa tradicional jugaría mejor: el punto es demostrar un jugador de IA que sigue instrucciones y gestiona representaciones diversas del estado. En wikiracing, selecciona entre cientos de enlaces reales mediante un procedimiento en dos tiempos que supera el límite de 255 opciones.
En ámbitos donde una probabilidad decide sobre una persona —como la selección de currículos— esa misma velocidad se convierte en un riesgo. Awesome-jev recomienda mantener las acciones de alto impacto protegidas por reglas deterministas y supervisión humana, y Paul Chada, cofundador de Doozer AI, recuerda en InfoWorld que una probabilidad muestra lo seguro que estaba el modelo, no por qué decidió así: distinción crucial ante auditores y autoridades.

Cero alucinaciones, errores reales
TypeSafe afirma que Jev no puede alucinar. En sentido estricto es cierto, y la empresa lo declara con honestidad: el cero no es una métrica de benchmark sino una propiedad estructural, porque el esquema garantiza que la salida tenga siempre la forma prevista. Si la pregunta solo admite sí y no, nunca saldrá «tal vez» ni una clave inventada. The Register juzga la comparación con los modelos lingüísticos poco precisa y recuerda que no elimina los errores; Goedecke habla de una evasión semántica.
Imaginad pedir a Jev, sobre un currículum, si la experiencia es de 3 a 5 o de 6 a 10 años. El modelo puede responder «de 6 a 10 años» con un 85% de probabilidad cuando un lector atento vería 3 años. Formato de esquema perfecto, decisión equivocada, confianza alta. Pages, citando al comentarista Anthony Maio, lo resume así: el esquema limita la forma de la respuesta, no la precisión del juicio. Del mismo modo, si se pregunta sobre una biografía si una persona tiene un doctorado y el texto no dice nada, el modelo puede responder sí al 65% solo por adivinar. El remedio es diseñar esquemas con vías de escape explícitas: añadir «otro» o «ninguna de las anteriores» a las listas de opciones. Para el sí o no no sirve: un 0,5 en un Noul no indica neutralidad, solo que sí y no se evalúan como igualmente probables.
La pregunta clave es si las probabilidades están bien calibradas. Según Pages, TypeSafe no ha publicado curvas de calibración. Existe un intento independiente (de un solo desarrollador, una sola cuenta, una sola región): Hume calculó sobre 1.200 preguntas del test MMLU un error de calibración esperado (ECE) de 0,031, bastante sólido. Sin embargo, en problemas matemáticos generados a propósito, el modelo acertó el 56% de las veces con una probabilidad media declarada del 35%. Además, al invertir el orden de las opciones, las probabilidades variaban (por ejemplo, de 0,84–0,89 a 0,93–0,96), lo que significa que un umbral de 0,9 puede activarse o no por razones ajenas al contenido.
En Papers, Please, el videojuego de Lucas Pope en el que se estampa «permitido» o «denegado» en los pasaportes de una fila interminable, la dificultad no radica en estampar el sello, sino en saber cuándo fiarse de los documentos. Ajustar los umbrales de Jev es ese mismo trabajo: cada sello cumple con el esquema, pero no todos los sellos son correctos.
Escépticos, rivales y preguntas abiertas
Quienes ya utilizan un modelo lingüístico con salidas estructuradas pueden preguntarse qué cambia realmente. Pages compara tres caminos. Un clasificador clásico, tipo BERT, es extremadamente rápido pero requiere miles de ejemplos etiquetados y debe reentrenarse para cada tarea. Un modelo lingüístico con esquema JSON es flexible pero lento y costoso, y sus probabilidades declaradas no son de fiar. Jev promete la flexibilidad del segundo con la rapidez del primero, con probabilidades nativas cuya calibración real queda por verificar de forma amplia.
¿Quién se beneficia? Los analistas consultados por InfoWorld prevén que Jev complemente a los modelos generalistas, que mantendrían el razonamiento abierto, la síntesis y la interacción, dejando a los modelos del Sistema 1 el enrutamiento, la puntuación, las auditorías y las verificaciones de conformidad. Pero la ecuación no es puramente técnica. Stephanie Walter, de HyperFrame Research, señala que las preguntas, opciones y umbrales deben definirse con antelación, mientras que Advait Patel, de Broadcom, recuerda los riesgos de depender de un proveedor joven: seguridad, residencia de datos e incompatibilidades. TypeSafe admite no poder demostrar que su precio no esté subvencionado. Ronacher predice que los competidores llegarán ahora que el patrón está claro, y TechCrunch informa de que la empresa sufrió interrupciones temporales de la API por la abrumadora demanda.
Quedan preguntas abiertas que solo el tiempo y las pruebas independientes podrán resolver: ¿se mantienen las probabilidades bien calibradas fuera de los cuatro flujos de prueba de la empresa? ¿Cómo rinde frente a evaluaciones con verdad humana absoluta? ¿Se publicará un artículo técnico sobre el RLCD? ¿Llegará el servicio a múltiples regiones y a qué precio? Y si Jevons tenía razón, ¿quién auditará el sistema cuando las decisiones automatizadas alcancen millones al día?
Menos palabras, más decisiones ejecutables: Jev no es un modelo más, sino una forma distinta de interactuar con el software. Linthicum imagina modelos de reflejo rápido junto a modelos de pensamiento deliberativo; Almeida sueña con un software inteligente omnipresente, tan cotidiano como la Web de los inicios. Si tienen razón, el ecosistema futuro será una orquesta de pequeños especialistas dirigidos por un modelo capaz de hablar. Si están equivocados, la lección principal seguirá siendo valiosa: descomponer los juicios complejos en preguntas sencillas y preguntarse siempre hasta qué punto podéis fiaros de la respuesta.
Datos actualizados a 20 de septiembre de 2026. Las afirmaciones sobre velocidad, coste y precisión proceden de TypeSafe o de desarrolladores individuales; no existen actualmente benchmarks independientes completos ni revisados por pares.