inteligencia-artificial

DeepSeek lanza un modelo de visión experimental que acerca su IA a Claude Opus 4.8 sin subir el precio

Fotografía que ilustra la noticia: DeepSeek lanza un modelo de visión experimental que acerca su IA a Claude Opus 4.8 sin subir el precio
(hipertextual.com)

DeepSeek ha lanzado DeepSeek-V4-Flash-Vision-Exp, una variante experimental de su modelo insignia que añade capacidades de interpretación de imágenes y capturas de pantalla. La compañía china asegura que su rendimiento se acerca al de Claude Opus 4.8 de Anthropic, el modelo más avanzado de la firma estadounidense, pero manteniendo el mismo esquema de precios que la versión de solo texto.

Una variante experimental sobre la base de V4 Flash

DeepSeek ha presentado DeepSeek-V4-Flash-Vision-Exp, una versión experimental del modelo V4 Flash que la compañía lanzó hace unos meses. La novedad principal es que esta variante ahora puede procesar contenido visual, una función que hasta ahora estaba reservada a la familia DeepSeek-VL.

Según una publicación de la compañía en su cuenta de X, el nuevo modelo conserva el mismo nivel de razonamiento y conocimiento general que V4 Flash en su versión de solo texto. Además, hereda las capacidades de agente, lo que le permite interpretar imágenes y ejecutar tareas sin supervisión constante. Es en este punto donde DeepSeek afirma que el rendimiento de Vision-Exp se acerca a Opus 4.8, el modelo más avanzado de Anthropic.

La compañía ha destacado que la multimodalidad abre más casos de uso de agentes, y que el modelo funciona de forma fluida con los principales frameworks de agentes del mercado, combinando comprensión visual con herramientas diversas.

Coste: visión sin incremento de precio

El argumento competitivo de DeepSeek frente a rivales como Claude y ChatGPT no es solo la capacidad técnica. Mientras que los modelos comerciales de OpenAI y Anthropic ya ofrecen capacidades de visión multimodal avanzada, la ventaja de DeepSeek reside en que lo hace a un coste mucho menor que Claude Opus 4.8 y el resto de modelos comerciales.

La compañía china ha decidido mantener el mismo esquema de precios de DeepSeek V4 Flash en su versión de texto para la nueva variante, lo que significa que añadir capacidades de visión no incrementa el coste para los usuarios de la API.

La plataforma tokeniza las imágenes para efectos de facturación, con un máximo de 384 tokens por archivo. Esto permite a los desarrolladores controlar el coste de procesamiento de cada solicitud.

Acceso, formatos y limitaciones técnicas

El acceso a DeepSeek-V4-Flash-Vision-Exp se realiza a través de la API de la compañía. Para empezar, es necesario registrarse en la plataforma y obtener acceso a la API. Una vez configurada la solicitud con el comando deepseek-v4-flash-vision-exp, las imágenes pueden enviarse en formato base64, a través de URLs externas o por medio de la API de archivos que DeepSeek también ha lanzado junto con el modelo.

La API de archivos permite reutilizar una imagen en otras solicitudes usando solo un identificador, sin necesidad de subirla de nuevo. Este servicio es gratuito y funciona con los principales frameworks de agentes disponibles en el mercado.

El modelo tiene limitaciones técnicas: solo admite archivos en formato JPEG, PNG, GIF y WebP, con una dimensión máxima de 8192 píxeles por lado. Los archivos no deben superar los 32 MiB si se usan base64 o una URL externa, o 64 MiB si se opta por la API de archivos. La IA puede procesar un máximo de 600 imágenes por petición.

Antes de la inferencia, cada imagen se redimensiona automáticamente. Las que sean iguales o menores a 384 x 384 píxeles se ampliarán manteniendo su relación de aspecto, mientras que las más grandes se reducirán de modo que el recuento total sea similar a una imagen de 800 x 800 píxeles. Las respuestas incluyen razonamiento integrado y análisis visual en la misma llamada.