DeepSeek presenta una IA que interpreta imágenes casi tan bien como Claude Opus 4.8

Wait 5 sec.

Si el lanzamiento de Kimi K3 y Qwen 3.8 no fue suficiente, Anthropic tiene otra preocupación más proveniente de China. DeepSeek lanzó una versión experimental de su modelo insignia, el cual es capaz de interpretar imágenes y capturas de pantalla. Sus creadores afirman que el rendimiento se acerca a Claude Opus 4.8 y puede probarse gratis.De acuerdo con una publicación en su cuenta de X, DeepSeek-V4-Flash-Vision-Exp es una variante experimental del modelo V4 Flash que debutó hace unos meses. Aunque esta versión parte de la misma base, la diferencia está en que ahora puede procesar contenido visual, una función que solo estaba reservada a la familia DeepSeek-VL.La compañía explicó que el DeepSeek-V4-Flash-Vision-Exp conserva el mismo nivel de razonamiento y conocimiento general que V4 Flash en su versión de solo texto. También hereda las capacidades de agente, lo que le permite interpretar imágenes y ejecutar tareas sin supervisión constante. Es en esto último donde DeepSeek asegura que el rendimiento de Vision-Exp se acerca a Opus 4.8, el modelo más avanzado de Anthropic.Multimodality unlocks more agent use cases. 👀V4-Flash-Vision-Exp works smoothly across agent frameworks, combining visual understanding with a wide range of tools to unlock more practical workflows.2/n pic.twitter.com/pZFf8Yqw3D— DeepSeek (@deepseek_ai) August 21, 2026Si bien Claude y ChatGPT ya ofrecen capacidades de visión multimodal avanzada, la ventaja con DeepSeek es que lo hace a un coste mucho menor que Opus 4.8 y el resto de modelos comerciales. La compañía china ha decidido mantener el mismo esquema de precios de DeepSeek V4 Flash en su versión de texto, lo que significa que añadir visión no incrementa el valor.Cómo usar DeepSeek-V4-Flash-Vision-Exp, el nuevo modelo que compite con Claude y ChatGPTEl acceso a DeepSeek-V4-Flash-Vision-Exp se realiza a través de la API de la compañía. El sistema admite entradas mixtas de texto e imagen que pueden enviarse en formato base64, a través de URLs externas o por medio de la API de archivos que también lanzó DeepSeek junto con el modelo.La plataforma tokeniza las imágenes para efectos de facturación, con un máximo de 384 tokens por archivo. Si usas la API de archivos, DeepSeek te permitirá reutilizarla en otras solicitudes usando solo un identificador, por lo que no habrá necesidad de subirla de nuevo. Este servicio es gratuito y funciona con los principales frameworks de agentes que están disponibles en el mercado.DeepSeek-V4-Flash-Vision-Exp tiene algunas limitantes. Según la documentación, el modelo solo admite archivos en formato JPEG, PNG, GIF y WebP, con una dimensión máxima de 8192 píxeles por lado. Los archivos no deberán superar los 32 MiB si usas base64 o una URL externa, o 64 MiB si optas por la API de archivos.La IA puede procesar un máximo de 600 imágenes por petición. Antes de la inferencia, cada imagen se redimensiona automáticamente. Aquellas que sean iguales o menores a 384 x 384 píxeles, se ampliarán manteniendo su relación de aspecto. Por otro lado, las más grandes se reducirán de modo que el recuento total será similar a una imagen de 800 x 800 píxeles.Para empezar a usar DeepSeek‑V4‑Flash‑Vision‑Exp, primero debes registrarte en la plataforma de DeepSeek y obtener el acceso a la API. Una vez que lo haces, basta con configurar tu solicitud indicando el modelo con el comando deepseek-v4-flash-vision-exp. Las imágenes pueden enviarse en los formatos mencionados y recibirás la respuesta con razonamiento integrado y análisis visual en la misma llamada.Seguir leyendo: DeepSeek presenta una IA que interpreta imágenes casi tan bien como Claude Opus 4.8