Etiqueta: DeepSeek-V4-Flash-Vision-Exp

  • DeepSeek lanza un modelo de IA experimental que rivaliza con Opus 4.8 de Anthropic en tareas de agentes y multimodal

    DeepSeek lanza un modelo de IA experimental que rivaliza con Opus 4.8 de Anthropic en tareas de agentes y multimodal

    El laboratorio chino de inteligencia artificial (IA) DeepSeek lanzó DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental que incorpora capacidades de visión y que, según las pruebas difundidas por la propia compañía, supera al modelo Opus 4.8 de Anthropic en tres de once evaluaciones de rendimiento.

    El nuevo sistema añade funciones de visión al anterior V4-Flash, por lo que puede interpretar imágenes y capturas de pantalla, además de procesar texto. Esta incorporación amplía sus posibilidades para desarrollar tareas mediante agentes de IA que necesitan analizar información visual.

    «Este modelo multimodal experimental iguala a DeepSeek-V4-Flash en capacidades de texto, incluyendo agentes, razonamiento y conocimiento del mundo», afirma DeepSeek en su anuncio en X (antes Twitter), donde sostiene que es un gran salto sobre V4-Flash que acerca su rendimiento como agente multimodal al mencionado de Anthropic.

    Según la tabla de resultados divulgada por DeepSeek, su nuevo modelo supera a Opus 4.8 en tres evaluaciones: DeepSWE, Agents’ Last Exam y ZeroBench. Sin embargo, queda por detrás del modelo de Anthropic en las otras ocho pruebas, incluida NL2Repo, enfocada en tareas complejas relacionadas con repositorios, donde la diferencia alcanza los doce puntos.

    Frente a V4-Flash, que funciona únicamente con texto, el nuevo modelo experimental obtuvo mejores resultados en seis de las siete evaluaciones de texto. La diferencia principal entre ambas versiones es que DeepSeek-V4-Flash-Vision-Exp también puede procesar información procedente de imágenes.

    DeepSeek habilitó el modelo en su plataforma de interfaz de programación de aplicaciones (API) y presentó la versión 0.1.1 de su entorno para agentes, que ya incluye soporte para el nuevo sistema. El modelo permite enviar fotografías y capturas de pantalla, que son convertidas en unidades de procesamiento o “tokens” y cobradas con la misma tarifa aplicada al texto estándar, con un máximo de 384 por imagen.

    La compañía incorporó además una API de archivos que permite cargar una imagen una sola vez y reutilizarla posteriormente en diferentes consultas. Con esta función, los usuarios no necesitan volver a subir el mismo archivo cada vez que quieran utilizarlo con el modelo.

    El medio especializado TNW señala que procesar un millón de palabras con el modelo de DeepSeek cuesta $0.87, frente a cerca de $50 con Opus 4.8 de Anthropic. La compañía china busca así competir tanto en rendimiento como en costos dentro del mercado de modelos de IA orientados al razonamiento, agentes y procesamiento multimodal.