Новости

Новостной портал GADGETPAGE » Новости » DeepSeek научила новую ИИ-модель видеть изображения и приблизила её к Claude Opus 4.8

DeepSeek научила новую ИИ-модель видеть изображения и приблизила её к Claude Opus 4.8

DeepSeek расширяет возможности семейства V4. Компания представила экспериментальную V4-Flash-Vision-Exp — версию ИИ-модели, которая умеет работать не только с текстом, но и с изображениями.

Новая система может анализировать фотографии, скриншоты и другие визуальные материалы, сохраняя при этом навыки рассуждений, программирования и работы в составе автономных ИИ-агентов.

Теперь модели можно показать экран

Главное изменение легко объяснить на бытовом примере.

Обычной текстовой модели приходится подробно описывать, что находится на изображении. Мультимодальной можно просто отправить сам файл и задать вопрос.

Например, пользователь может приложить скриншот программы и попросить найти ошибку в интерфейсе, показать фотографию графика или дать изображение документа для анализа.

Для ИИ-агентов это ещё важнее.

Если система должна самостоятельно работать с программами, ей необходимо понимать, что находится на экране: где кнопка, какое окно открылось и какой результат появился после предыдущего действия.

Поэтому зрение постепенно превращается из дополнительной возможности нейросети в один из основных компонентов агентных систем.

Старые способности сохранились

V4-Flash-Vision-Exp не создавалась как отдельная модель только для распознавания картинок.

Она сохраняет возможности базовой V4-Flash: работу с обычным текстом, рассуждения, использование накопленных знаний и выполнение задач через внешние инструменты.

В результате один и тот же ИИ может принять скриншот, разобраться в его содержимом, спланировать дальнейшие действия и продолжить работу уже через программные интерфейсы.

Такой подход удобнее цепочки из нескольких специализированных моделей, где одна отвечает за зрение, вторая — за анализ, а третья — за выполнение команд.

С Claude сравнивали именно агентные задачи

Самое громкое заявление касается производительности.

DeepSeek утверждает, что в тестах мультимодальных агентов новая версия демонстрирует результат, близкий к Claude Opus 4.8.

Однако здесь важен контекст.

Речь не идёт о том, что новая модель однозначно равна Claude по всем возможным сценариям. Сравнение относится к определённой категории тестов, а результаты опубликовала сама DeepSeek.

Независимые проверки ещё могут показать другую картину на задачах с длинным контекстом, программированием, математикой или сложным анализом изображений.

Поэтому корректнее говорить о приближении к уровню сильного конкурента именно в мультимодальном агентном режиме.

Картинка превращается максимум в 384 токена

Для разработчиков важна стоимость работы модели.

DeepSeek преобразует каждое изображение максимум в 384 токена. После этого они оплачиваются по тарифам обычной V4-Flash.

Фактически картинка для API становится ещё одной частью входного контекста.

От количества токенов зависит стоимость обработки, поэтому ограничение в 384 единицы позволяет заранее понимать порядок расходов при массовой работе с визуальными запросами.

Это может быть особенно важно для сервисов, ежедневно анализирующих тысячи скриншотов или фотографий.

Если обработка одного изображения слишком дорога, даже качественная модель быстро становится экономически невыгодной для массового продукта.

Новая версия уже доступна разработчикам

Экспериментальная модель появилась в API DeepSeek.

Одновременно выпущен DeepSeek Harness 0.1.1, который поддерживает её без необходимости самостоятельно создавать отдельную интеграцию.

Это показывает, что разработчик рассматривает Vision-Exp не только как исследовательскую демонстрацию.

Модель можно подключать к реальным приложениям и проверять на собственных сценариях, хотя статус экспериментальной версии означает, что её поведение и характеристики ещё способны меняться.

Мультимодальность становится обязательной

Ещё несколько лет назад главным соревнованием больших языковых моделей было качество текста.

Теперь этого недостаточно.

Современный ИИ должен понимать изображение, работать с файлами, использовать браузер, запускать инструменты и самостоятельно выполнять цепочки действий.

Именно поэтому DeepSeek делает акцент на мультимодальных агентах, а не просто на способности описать фотографию.

Для разработчиков разница принципиальная.

Система, которая видит экран и понимает его состояние, потенциально способна выполнять работу непосредственно в графическом интерфейсе, даже если у программы нет удобного API.

Это открывает путь к агентам, которые управляют приложениями почти так же, как человек.

V4-Flash-Vision-Exp пока остаётся экспериментом, но направление вполне понятно: DeepSeek пытается сделать зрение стандартной частью своей ИИ-платформы и при этом сохранить доступную модель тарификации. Если результаты независимых испытаний подтвердят заявленный уровень, конкуренция с крупнейшими закрытыми моделями станет ещё плотнее