Strands publicó el 9 de octubre de 2026 strands-decider-2B-qwen3.5-v1-2610, una nueva versión de su modelo para elegir opciones y puntuar decisiones dentro de un agente. La ficha documenta cambios respecto a Hobson v21 y una advertencia práctica: una respuesta con confianza alta puede seguir siendo incorrecta cuando falta una imagen necesaria.

Esta noticia se centra en el paquete Qwen de 2B. No compara toda la familia ni propone un ganador entre proveedores. En nuestra comparativa de modelos de decisión explicamos los paquetes Hobson v19 y v21; el lanzamiento de v1 añade una receta distinta, sin renombrar aquellas versiones.

Qué cambia en el paquete

Según la ficha del autor, la mezcla de entrenamiento incorpora tareas de código y aplicación de reglas escritas a casos concretos. También retira 20.000 filas procedentes de conjuntos con restricciones de uso comercial. El modelo publicado combina tres ejecuciones de entrenamiento de la misma receta y después se calibra. Estos cambios no demuestran por sí solos que vaya a resolver mejor cualquier tarea empresarial.

El artefacto contiene un adaptador LoRA, una adaptación del modelo base, y una cabeza que puntúa las opciones. Necesita los pesos de Qwen/Qwen3.5-2B-Base por separado. Las preguntas pueden pedir una elección entre candidatos, una respuesta de sí o no o un nivel de una escala ordenada. Conviene distinguir ese paquete de un modelo de conversación completo.

El código, el paquete y el modelo base declaran Apache 2.0. Los datos conservan sus propias condiciones: la nota de licencia enumera fuentes con atribución, obligaciones de compartir bajo condiciones similares y términos particulares o no declarados. Retirar algunas filas no convierte automáticamente todos los datos en Apache 2.0 ni elimina la necesidad de revisar sus condiciones.

Un ejemplo: decidir a qué equipo enviar una solicitud

Imaginemos una bandeja que clasifica mensajes entre facturación, soporte y comercial. El modelo puntuaría esas opciones; el sistema decidiría cuándo aceptar la propuesta y cuándo pedir revisión humana. Es un ejemplo hipotético, no ejecutado por Puntoes.

Antes de automatizar, prepararíamos mensajes representativos del servicio, incluidos casos ambiguos y mensajes en español. Mediríamos errores y fijaríamos el umbral con esos datos. La ficha explica que la calibración se ajustó sobre tareas cortas: no acredita que la misma confianza se mantenga en otro idioma, dominio o escala de valoración.

La imagen debe comprobarse antes de decidir

La ruta visual utiliza la torre de visión del modelo base; el adaptador no fue entrenado con imágenes. El autor documenta que, al retirar imágenes de sus evaluaciones, el modelo sigue respondiendo con exceso de confianza. Su recomendación es comprobar la presencia de la imagen antes de preguntar, en lugar de usar esa confianza para detectar archivos ausentes, vacíos o ilegibles.

En nuestro ejemplo, una solicitud que exige leer una captura necesitaría esa comprobación previa y una ruta de revisión si falla. Además, la ficha señala dificultades con documentos largos, cambios en la pregunta y rúbricas alejadas del entrenamiento.

La reproducción del entrenamiento tiene otro límite: los constructores de la mezcla de datos aún no están en main, según la ficha consultada. Publicar la receta y el checkpoint no equivale a poder reconstruir todo el proceso. No hemos descargado los pesos ni ejecutado pruebas; los resultados de la ficha pertenecen al autor.

Fuentes

Sigue explorando