Cloudflare lanzó Clef-omni el 9 de octubre de 2026 y anunció dos cambios en su familia de modelos de decisión: una rebaja de Clef-flash y una aceleración del servicio Clef. Para quien ya integra Flash, la novedad más delicada es el contexto: baja de los 64k anunciados anteriormente a unos 24k. La nota original de Cloudflare distingue estos cambios del lanzamiento inicial del 1 de octubre, que recogimos en la comparativa de modelos de decisión.

Decidir con audio, sin generar una conversación

Clef-omni recibe texto, imágenes, audio y vídeo, incluido sonido. Devuelve probabilidades para las opciones de preguntas definidas por la aplicación; no produce respuestas libres ni voz. Su ficha de pesos identifica la base Qwen3-Omni-30B-A3B-Instruct y la licencia Apache 2.0.

Un ejemplo hipotético, no ejecutado por Puntoes: un equipo de soporte recibe una captura de pantalla y una nota de voz. Podría preguntar qué departamento debe atender el caso y si requiere revisión urgente. Las opciones deberían incluir una salida hacia revisión humana cuando el material sea insuficiente. Esto describe un diseño posible, no una precisión demostrada.

Separar clasificación y acción sigue siendo necesario: una probabilidad no concede permiso para emitir un reembolso. La aplicación debe decidir qué acciones permite y qué evidencia conserva para revisarlas.

Flash cuesta menos, pero puede leer menos

La tarifa anunciada de Clef-flash pasa de 0,09 a 0,038 dólares por millón de tokens de entrada. Los tokens son las unidades en que el modelo procesa el contenido. Su ficha del servicio precisa una ventana de 24.576 tokens y advierte de que el estado textual se recorta para ajustarse al espacio restante tras preguntas y medios.

Por eso, una integración puede seguir respondiendo aunque haya perdido información. Imaginemos, sin haberlo probado, un expediente de 35.000 tokens con la condición decisiva cerca del final: ya supera la nueva ventana incluso antes de añadir preguntas. No conviene depender de recibir un error para descubrirlo. Recomendamos comprobar la longitud antes del envío y evaluar casos donde la información relevante aparezca en posiciones distintas.

Cloudflare afirma que los pesos de Flash no han cambiado. Esa reducción afecta al servicio alojado; los pesos descargables y la configuración de ejecución local tienen sus propios límites. No basta con descargar el modelo para asumir que se puede procesar cualquier longitud.

Coste multimodal y límites de integración

La documentación de Clef-omni alojado indica 64.000 tokens de contexto y 0,15 dólares por millón de tokens de entrada, sin cobro de tokens de salida. Imágenes, audio y vídeo también se convierten en tokens facturables y ocupan contexto. Acepta vídeos de hasta 60 segundos por clip; los límites de tamaño y cantidad también cuentan. No admite enlaces remotos como entrada multimedia.

Estas condiciones obligan a preparar los archivos y medir su coste antes de automatizar un flujo. Una evaluación útil debería incluir audio poco claro, capturas incompletas y casos sin evidencia suficiente, con etiquetas humanas para contrastar las decisiones. Es una propuesta de prueba; aquí no hemos llamado a la API ni medido calidad, latencia o ahorro.

La aceleración anunciada de Clef corresponde a optimizaciones del servicio y a mediciones del fabricante. No acredita mejoras equivalentes al alojarlo por cuenta propia. En Omni, la ficha local cita una H200 y unos 64 GB de memoria gráfica para el backbone en bfloat16; tampoco lo presenta como una instalación ligera. Añadir modalidades amplía los casos posibles, pero elegirlas exige verificar que resuelvan un problema real de la aplicación.

Fuentes

Sigue explorando