Para elegir entre Jev y una alternativa abierta hay que distinguir tres cosas: el modelo que toma la decisión, el servidor que lo ejecuta y las condiciones que permiten utilizarlo. Un proyecto con una API parecida no contiene necesariamente el mismo modelo ni ofrece sus mismas garantías.

Esta es una comparativa documental ampliada, revisada el 7 de octubre de 2026. No hemos ejecutado estos modelos ni medido su velocidad. Los proyectos abiertos descritos aquí son implementaciones independientes, no versiones oficiales de Jev.

Qué hace Jev y qué parte puedes ejecutar tú

La documentación oficial de TypeSafe presenta Jev como un modelo de decisiones estructuradas: recibe un estado y preguntas y devuelve opciones, puntuaciones o probabilidades. Por ejemplo, puede elegir entre varias categorías de un ticket en vez de redactar una respuesta larga.

La página oficial de modelos documenta Jev 1.13 con el identificador jev-1.13.0. Se consume mediante una API; no hemos encontrado una distribución oficial descargable de sus pesos en las fuentes oficiales consultadas. Para reproducir una evaluación conviene registrar el identificador exacto usado.

La estructura de la salida ayuda a integrarlo con código, pero un dato bien formado puede ser una decisión equivocada. La probabilidad tampoco autoriza una acción ni sustituye la comprobación de una política.

Servicios gestionados y modelos descargables

Oferta Acceso que hemos verificado Qué distinguir
Jev de TypeSafe Servicio API Identificador exacto, condiciones y evaluación de tu tarea
Cloudflare Clef y Clef-flash Workers AI y pesos Apache 2.0 Modelo de Cloudflare frente a alojar un modelo de otro autor
Perplexity Decider Paquetes de pesos de v1 y v1.1; v1 también documenta evaluación por API La revisión local y la servida pueden ser distintas
OpenAI Decisions API API documentada entre Beta APIs Es una oferta de servicio; esa referencia no publica un modelo de pesos abiertos

Cloudflare tiene modelos propios: Clef 27B y Clef-flash 9B. Eso es distinto de que Workers AI aloje otros modelos. OpenAI documenta clasificación y puntuación sobre una entrada compartida, con respuestas ordenadas y posibilidad de negativa; incluimos su API como alternativa gestionada, sin atribuirle una arquitectura o un checkpoint abierto que esa referencia no establece.

Catálogo ampliado de pesos y modelos de decisión

Las licencias de esta tabla son las declaradas en las fichas originales, consultadas con revisiones fijadas. También hay que revisar modelo base, dependencias y datasets. Pesos descargables, software abierto y permiso comercial son aspectos diferentes.

Familia y fichas originales Variantes y ejecución Licencia declarada en las fichas
Clef / Clef-flash: clef / clef-flash 27B / 9B; texto, JSON, imágenes y vídeo; local o Workers AI Apache 2.0
Perplexity Decider: pplx-decider-v1-27b / pplx-decider-v1.1-27b 27B, versiones v1 y v1.1; paquete multimodal con lectura específica Apache 2.0
Strands Decider: strands-decider-2B-hobson-v19 / strands-decider-2B-hobson-v21 Hobson 2B v19 / v21; adaptador y cabeza; base por separado Apache 2.0
Tev1: Tev1-0.8B-experimental / Tev1-4B-experimental 0.8B / 4B experimentales; elección de etiquetas mediante cabeza de lenguaje Sin licencia declarada en los metadatos consultados
Laya: laya / laya-multilingual / laya-typed-decisions Variantes inglesa, multilingüe y especializada en workflows; encoders Apache 2.0
Kev de Jared Palmer: kev-0.8b / kev-4b / kev-9b / kev-27b 0.8B / 4B / 9B / 27B; familia de modelos con cabeza de decisión Apache 2.0
JevK5: JevK5 4B, revisión v0.3; puntuación de opciones y runtime propio Apache 2.0
Plumb: plumb-4b 4B derivado de JevK5; servidor y política de lectura propios Apache 2.0
Imajev: imajev-2b / imajev-4b / imajev-9b 2B / 4B / 9B; decisiones con texto e imágenes; adaptadores y readout Apache 2.0
Winnow: Winnow-12B / Winnow-E4B / Winnow-E2B 12B / E4B / E2B; GGUF fusionados; decisión, chat e imágenes Apache 2.0
Von: von 395M, encoder ModernBERT; engine 1.3 con pesos de 1.2 Apache 2.0
Mica: Mica-v0.1-4B v0.1 4B; pesos fusionados, decisiones textuales Apache 2.0
Kestrel: kestrel-decider-230m 230M; receta Strands sobre LFM2.5, adaptadores y cabeza LFM Open License v1.0

Esta selección añade 13 familias y 26 publicaciones de modelos a las opciones iniciales. Conservamos Open-Jev y jevos abajo, y separamos Simple Jev como infraestructura. Los tamaños son nombres o tamaños aproximados del backbone; adaptadores y modelos fusionados requieren procedimientos diferentes.

Clef, Perplexity y Strands: qué cambia en la selección

Cloudflare lanzó Clef y Clef-flash el 1 de octubre de 2026, con licencia Apache 2.0 y basados en modelos Qwen3.8-27B y Qwen3.5-9B. Aceptan texto, JSON, imágenes y vídeo, y están disponibles en Workers AI y como pesos descargables. Anuncio oficial de Cloudflare.

En un piloto de revisión de documentos, una captura de pantalla puede aportar información que el texto extraído pierde. También puede contradecirlo: propondríamos una ruta de revisión humana para esos casos, en vez de resolverlos automáticamente por una confianza alta.

Perplexity lanzó modelos como pplx-decider-v1-27b y v1.1-27b, basados en Qwen3.8-27B y con licencia Apache 2.0. Ambos tienen paquetes multimodales; la tarjeta de v1.1 describe cambios de entrenamiento y atención respecto a v1. Sin embargo, no se debe asumir que estos modelos tengan ventajas claras sobre otros en el mercado o que sus métricas sean comparables sin probarlos directamente. Sus paquetes incluyen un código de lectura específico: no basta con tratarlos como un chatbot normal. Publicar pesos nuevos y actualizar un servicio alojado son hechos distintos; habría que confirmar qué revisión atiende cada llamada. Ficha de Perplexity v1.1.

Strands Decider publica Hobson v19 y v21: adaptadores LoRA y una cabeza de decisión sobre Qwen3.5-2B-Base. El modelo base se obtiene por separado. La ficha de v21 describe paráfrasis y destilación en su receta; el uso de imágenes depende del runtime y de la ruta de visión documentados. No lo trasladaríamos a otra versión sin comprobarlo. Ficha v21 y enlace a su código.

Familias abiertas para distintos despliegues

Kev, de Jared Palmer, publica cuatro tamaños verificados en esta revisión: 0.8B, 4B, 9B y 27B. El paquete 27B documenta una versión con pesos completos sobre Qwen3.8 y cabeza de decisión; las variantes pequeñas deben consultarse por separado. No lo confundimos con otro servidor llamado Kev. Ficha de Kev 27B.

JevK5 y Plumb están relacionados: la ficha de Plumb identifica JevK5 como base y describe un servidor y políticas de lectura propios. Al compararlos congelaríamos tanto los pesos como el runtime y la calibración. JevK5 y Plumb 4B.

Imajev publica 2B, 4B y 9B para decisiones con texto e imágenes, con adaptadores y componentes de lectura. Winnow publica 12B, E4B y E2B en GGUF fusionados y combina decisiones, chat y entradas visuales. Para imágenes requiere el proyector correspondiente; sus políticas de razonamiento adaptativo deben distinguirse de la decisión directa. Imajev 4B y Winnow 12B.

Mica v0.1 4B es otra alternativa textual con pesos fusionados y una API compatible. Su ficha describe entrenamiento en inglés y coreano; eso no permite asumir rendimiento en español. Ficha de Mica.

Open-Jev: diferencias entre 2B, 9B y 27B

El proyecto Open-Jev, desarrollado por Zefan Cai, ofrece versiones de 2B, 9B y 27B basadas en modelos Qwen. Estas versiones incluyen adaptaciones de LoRA, cabezas de decisión y calibración de temperatura, pero no incluyen los pesos base de Qwen, lo que requiere la instalación de cargadores y pesos separados. El código original tiene licencia MIT; las tres tarjetas de los paquetes de modelo indican Apache 2.0. Los datasets y dependencias conservan sus propias condiciones. Necesitan el cargador del proyecto y la revisión exacta del modelo base. No basta con abrir estos adaptadores como si fueran un modelo de chat completo o un GGUF cualquiera. LoRA es una adaptación que modifica una parte del comportamiento del modelo base; la cabeza de decisión puntúa los candidatos. Repositorio y documentación.

Paquete Modelo base indicado en su tarjeta Qué comprobar al desplegar
Open-Jev-2B Qwen3.5-2B Cargador, revisión fijada y límites de tu prueba local
Open-Jev-9B Qwen3.5-9B Memoria disponible para el tamaño de entrada y el backend escogido
Open-Jev-27B-v1.1 Qwen3.8-27B Cambio de base, paquete v1.1 y evaluación en las mismas tareas

“B” indica aproximadamente miles de millones de parámetros del modelo base, no del adaptador descargado. Un tamaño mayor no demuestra que sea mejor para tu problema. La memoria también depende de precisión, tamaño de entrada y procesamiento simultáneo; no damos una cifra universal de RAM o GPU.

Los resultados publicados por el proyecto corresponden a protocolos y versiones de evaluación concretos. Comparar porcentajes de subconjuntos diferentes como si fueran el mismo examen produciría un ranking engañoso.

jevos: una opción centrada en ejecución local

Otra alternativa es jevos por feder-cr, que ofrece la publicación jevos-v4 para CPU: un artefacto OpenVINO INT8 y archivos GGUF Q4_K_M y Q8_0. Estas versiones incluyen implementaciones propias para preguntas binarias, elecciones y puntuaciones, y su código está bajo licencia MIT. Sin embargo, la licencia de los pesos no se ha verificado en esta comparativa, y no se debe extender la licencia MIT del código a los pesos. El autor publica mediciones de latencia; aquí no las hemos reproducido. Tener un endpoint parecido no basta para asumir equivalencia en todas las preguntas o clientes. Repositorio de jevos.

INT8 y las variantes GGUF describen representaciones del modelo; no son nuevos lanzamientos oficiales de Jev. Para una prueba offline puede ser una opción a estudiar, siempre comprobando los artefactos, sus condiciones y el comportamiento real sobre tus entradas.

Simple Jev: conservar el modelo y cambiar la interfaz

Por su parte, simple-jev de Featherless-AI es un servidor con código Apache 2.0 que trabaja sobre un modelo elegido por el usuario, cuya licencia debe revisarse por separado. Utiliza logits para puntuar opciones sin generar respuestas. Los logits son las puntuaciones que el modelo asigna antes de seleccionar un token. El servidor las utiliza para construir decisiones estructuradas. No reproduce la arquitectura o el entrenamiento de Jev ni demuestra por sí mismo la misma calibración, precisión o velocidad. Repositorio de Simple Jev.

Puede encajar en un piloto que ya dispone de un modelo abierto. Nuestra comparación propuesta tendría que incluir la sensibilidad a las instrucciones y a la forma de describir las opciones: cambiar el envoltorio no elimina los errores del modelo base.

Un caso empresarial: clasificar no es autorizar

Imagina un ticket ficticio: “No puedo entrar en facturación; soy administrador”. Podemos pedir dos decisiones separadas: categoría del ticket y necesidad de revisión urgente. Después, el software determina a qué cola enviarlo.

La frase “soy administrador” no demuestra permisos. La identidad y el acceso a facturas se comprueban contra el sistema de autorización, independientemente de la confianza del modelo. Una categoría equivocada puede retrasar la atención; una autorización equivocada puede exponer información. Son riesgos diferentes y deben tener controles distintos.

Esta separación permite usar un componente de decisión para ordenar o derivar solicitudes, mientras el resto del flujo sigue reglas comprobables. Tampoco implica que añadir otro modelo abarate el sistema: hay que contar esa llamada y las revisiones que provoca.

Las alternativas pequeñas también necesitan un examen propio

La familia Laya reúne tres checkpoints: uno inglés, otro multilingüe y otro adaptado a workflows concretos. Utilizan encoders como ModernBERT y mmBERT. Elegir el correcto es parte de la comparación: el soporte de idiomas o contexto de una variante no se aplica automáticamente a las demás.

Von documenta un encoder ModernBERT de 395M parámetros. Su motor 1.3 conserva los pesos de 1.2: una actualización de runtime no significa un nuevo entrenamiento. Para clasificar entradas acotadas, ambas familias merecen un piloto antes de reservar una GPU grande.

Kestrel Decider 230M adapta la receta de Strands a LFM2.5-230M-Base. Es un proyecto comunitario con licencia LFM Open License v1.0 y condiciones comerciales propias. Que los pesos estén accesibles no permite asumir las mismas condiciones que Apache 2.0.

Tev1 de Together AI publica variantes experimentales 0.8B y 4B que conservan la cabeza de lenguaje de Qwen. Resuelven decisiones seleccionando etiquetas, con un mecanismo diferente al de una cabeza de decisión sin generación. Las fichas consultadas no declaran licencia en sus metadatos; esa información debe aclararse antes de asumir derechos de uso sobre los pesos.

Un benchmark no decide por tu empresa

Propondríamos evaluar tickets en español, capturas de documentos, información ausente, contradicciones y textos que intenten manipular la decisión. Los ejemplos sintéticos pueden iniciar el piloto; los datos reales requerirían autorización y anonimización. Mantendríamos casos reservados para evaluar, sin utilizarlos para ajustar instrucciones.

Mediríamos errores por clase, cobertura de automatización, abstenciones, calibración y casos enviados a revisión. Para latencia registraríamos mediana y percentil 95, separando arranque, caché fría y caliente. Compararíamos peticiones completas, incluyendo la red cuando exista: una operación de GPU y una llamada a API no son la misma medición.

Fijaríamos modelo y revisión, cargador, lectura de probabilidades, instrucciones y configuración. Un mismo endpoint no garantiza el mismo tratamiento de opciones o negativa a responder. Probaríamos también reglas sencillas como referencia: quizá basten para parte del problema.

Los benchmarks ayudan a descubrir candidatos. Antes de comparar puntuaciones hay que comprobar versión, subconjunto, idiomas, modalidad y si se ajustó algo usando esos datos. Un ranking textual no demuestra calidad con imágenes; una cuantización o una política de razonamiento puede cambiar resultados y coste. No hemos medido estas opciones en Puntoes y no publicamos un ganador propio.

Para preparar los criterios de revisión, consulta cómo calibrar un LLM como juez. La elección final partiría de una decisión empresarial y del coste de equivocarse, y se comprobaría en un piloto reproducible.

Por dónde empezar según el problema

  • Imágenes o documentos visuales: estudiar Clef/Clef-flash, Perplexity Decider e Imajev; Winnow también aporta una ruta visual local que exige su proyector.
  • Encoder y entradas acotadas: explorar Laya o Von, con el idioma y el contexto adecuados. Kestrel necesita además revisar su licencia y sus límites publicados.
  • Control del entrenamiento y pesos: revisar Strands, Kev, Open-Jev, JevK5, Plumb o Mica según el tipo de paquete y la tarea.
  • Servicio gestionado: comprobar Jev, Clef en Workers AI, la oferta de Perplexity y OpenAI Decisions, incluyendo versiones disponibles y condiciones.
  • Modelo abierto ya elegido: Simple Jev puede ofrecer una interfaz de decisión sobre él. Sigue siendo necesario medir los errores del modelo base.

Son propuestas para seleccionar candidatos, no resultados comparativos propios. No hemos instalado ni ejecutado estos modelos ni contratado sus servicios. Un servidor, una cuantización y un modelo entrenado no se cuentan como tres familias distintas.

Fuentes

Las fichas de cada nueva familia y variante están enlazadas en el catálogo. Guardamos los identificadores, revisiones y licencias consultadas para poder actualizar la comparación.

Sigue explorando