Mientras otras IA dibujan adorables gatitos, esta maqueta libros de texto completos.

El equipo de Alibaba presentó Qwen-Image-3.0 — la tercera generación del modelo base para la generación y edición de imágenes. Los desarrolladores hicieron hincapié no tanto en ilustraciones espectaculares como en materiales que se pueden usar en el trabajo: infografías complejas, esquemas didácticos, páginas de periódico, guiones gráficos, interfaces y documentos con gran cantidad de texto pequeño.
Uno de los principales cambios fue la compatibilidad con instrucciones de hasta 4500 tokens. La versión anterior aceptaba alrededor de 1000, por lo que ahora el usuario puede describir en detalle la composición, la disposición de los objetos, los pies de foto, las fórmulas y el diseño de cada fragmento en un solo lienzo.
En una demostración, el modelo generó de una sola pasada una cuadrícula de nueve bloques independientes. Incluyó un cómic sobre seguridad en un túnel, lecciones de geometría y física, un esquema médico, materiales sobre biología y teoría de grupos, una infografía bancaria y una comparación de la estructura del ADN. Para describir toda la composición se necesitó una instrucción de aproximadamente 3700 tokens.
Qwen-Image-3.0 no solo debe situar múltiples elementos paralelos, sino también mantener la estructura anidada de la escena. En otro ejemplo, el sistema representó de forma secuencial la interfaz de Visual Studio Code, dentro de ella Qwen Chat, luego la ventana de WeChat y, todavía más adentro, un cartel publicitario. Cada área recibió su propio diseño y no se mezcló con las capas vecinas.
El segundo grupo de mejoras afecta a los detalles pequeños. Según los desarrolladores, la novedad es capaz de reproducir símbolos legibles de alrededor de diez píxeles, incluidas fórmulas LaTeX, subíndices, letras griegas, números de teoremas y desarrollos en varias líneas. En los ejemplos publicados el sistema genera una página de artículo científico, una página de periódico y un cartel informativo con numerosas leyendas.
Alibaba también muestra una reproducción más precisa de las texturas. En los retratos la red neuronal dibuja pelos sueltos, poros e irregularidades de la piel, y al restaurar cuadros dañados reconstruye las zonas perdidas intentando conservar las pinceladas originales, los degradados de tinta y la composición general. Un modo específico permite añadir en páginas escaneadas anotaciones manuscritas, subrayados, flechas y comentarios breves.
El modelo admite texto en 12 idiomas, más de 20 tipografías y más de 100 tendencias artísticas. Entre las muestras presentadas hay imágenes con inscripciones en chino, inglés, japonés, coreano y español. Además, el sistema puede reproducir interfaces de sitios web, aplicaciones, juegos y transmisiones, apoyándose en conocimientos sobre la estructura habitual de esas pantallas.
Los desarrolladores también indicaron la conexión a internet para obtener información actualizada. Al solicitar un pronóstico del tiempo para una ciudad y una fecha concretas, Qwen-Image-3.0 puede primero buscar los datos necesarios y luego presentarlos en forma de tarjeta lista. Ese flujo debería reducir la probabilidad de que aparezcan temperaturas inventadas y otros indicadores que cambian rápidamente, aunque la precisión del resultado depende del origen encontrado y de la correcta interpretación de la información.
Las capacidades también se extienden a la edición de imágenes originales. En un ejemplo el modelo convirtió la fotografía de un insecto en una ilustración científica, añadiendo clasificación, leyendas de las partes del cuerpo, fragmentos ampliados y una regla de escala. Este tipo de material lo proponen para educación, publicaciones científicas, diseño, comercio electrónico y creación de contenido.
No obstante, por ahora es difícil evaluar las capacidades reales de Qwen-Image-3.0. Alibaba no ha publicado un informe técnico, resultados de pruebas independientes, una ficha del modelo, el número de parámetros ni la licencia. En la colección oficial Qwen en Hugging Face están disponibles versiones abiertas de la generación anterior, incluida la Qwen-Image-2512 de veinte mil millones, pero los archivos de Qwen-Image-3.0 para ejecución local aún no están disponibles.
Por eso las afirmaciones sobre la reproducción sin errores de fórmulas pequeñas, páginas densas de periódico y composiciones complejas se basan por ahora en ejemplos seleccionados por la propia compañía. Los generadores de imágenes con frecuencia muestran resultados convincentes en solicitudes de demostración, pero cometen omisiones, distorsionan símbolos y rompen la estructura en pruebas sistemáticas.
Se puede probar el modelo a través de Qwen Studio en el navegador y de las aplicaciones móviles oficiales. También aparece en la documentación de la plataforma Alibaba Cloud Model Studio bajo el identificador qwen-image-3.0-pro. La versión en la nube admite generación y edición, ofrece hasta seis variantes por solicitud y funciona con una resolución de hasta 2048 × 2048 píxeles, sin embargo el acceso por ahora se proporciona en un modo de prueba cerrada.
No hay un precio público para Qwen-Image-3.0 ni pesos descargables libremente en el momento de la publicación. Así que el nuevo lanzamiento sigue siendo por ahora un servicio en la nube, cuyas capacidades los usuarios podrán comprobar plenamente solo después de ampliar el acceso, publicar la documentación y realizar comparaciones independientes con otros generadores.