§ БЛОГ

Анализ изображений в workflow: новая нода Staqflow — вопрос к фотографии и ответ структурой

В Staqflow появился узел «Анализ изображения»: показываете модели фото и задаёте свой вопрос — что на снимке, тот ли это товар, есть ли повреждения. Двенадцать провайдеров на том же ключе, что языковая модель, ответ текстом или сразу структурой по JSON-схеме.

Анализ изображений в workflow: новая нода Staqflow — вопрос к фотографии и ответ структурой

Фотографии приходят в бизнес непрерывно: продавец загрузил снимок товара, клиент прислал фото поломки, курьер сфотографировал подъезд, монтажник — готовую работу. С каждым снимком кто-то должен что-то решить: подходит или нет, то это или не то, есть ли на фото то, что обещали.

В Staqflow появился узел «Анализ изображения». Он показывает картинку модели и задаёт ваш вопрос — а дальше процесс работает с ответом как с обычными данными.

Анализ изображения в workflow — это шаг процесса, который передаёт картинку зрячей модели вместе с вопросом и возвращает ответ: текстом или сразу структурой по заданной схеме.

Чем это отличается от распознавания документов

Узел извлечения из документа заточен под бланки: он берёт PDF и заполняет заранее описанную форму. Узел анализа изображения устроен свободнее: ему задают вопрос своими словами — «что на фото», «сколько коробок на паллете», «читается ли номер», «соответствует ли фото описанию товара».

Если ответ нужен структурой, её можно потребовать и здесь — форматом ответа «JSON по схеме».

Двенадцать провайдеров

Зрение есть почти у всех, кого поддерживает платформа: OpenAI, Anthropic, Google Gemini, Qwen, Mistral, Groq, xAI, Perplexity, OpenRouter, Yandex, GigaChat и свой сервер на протоколе OpenAI. Отдельное подключение заводить не нужно — узел работает на том же ключе, что языковая модель.

Из общего списка выпадает только DeepSeek: картинку он не принимает.

Две особенности, которые стоит знать заранее:

  • Не каждая модель у провайдера — зрячая. Узел скажет об этом прямо: возьмите модель с vision, vl или omni в названии. Это не каприз — у большинства провайдеров зрение живёт в отдельных моделях.
  • GigaChat грузит картинку отдельно и принимает JPEG и PNG; остальные берут картинку прямо в сообщении и понимают PNG, JPEG, WebP и GIF.

Как настроить

  1. Добавьте подключение к сервису в учётных данных пространства.
  2. Поставьте узел «Анализ изображения», выберите провайдера и зрячую модель.
  3. Укажите источник картинки: бинарное поле элемента — фото из Telegram, вложение из почты, файл из хранилища — или ссылка.
  4. Задайте вопрос. Это обычный текст с выражениями: На фото должен быть {{ $json.product }}. Это он?
  5. Выберите формат ответа: текст или JSON по схеме.

Системный промпт задаёт роль и правила на все запросы сразу: «отвечай одним словом», «ты приёмщик на складе, проверяй по чек-листу», «если не уверен — так и скажи».

Когда просить JSON

Свободный текст удобен человеку: его отправляют в чат, и там его читают. Процессу удобнее структура — по ней можно ветвиться без разбора строк.

Простой приём: спрашивайте не «что на фото», а «заполни поля» — и описывайте схему с полями вроде matches (да или нет), reason (почему) и defects (список). Дальше узел условия смотрит на matches, и ручной разбор остаётся только для спорных случаев.

Параметры

  • Температура — для проверок держите низкой: от модели нужна повторяемость, а не фантазия.
  • Предел токенов ответа. Если ответ обрывается, узел прямо скажет: поднимите предел или возьмите модель без длинных размышлений.
  • Top P и зерно — тонкая настройка и повторяемость там, где провайдер это умеет.
  • Таймаут и сырой ответ — на случай долгих моделей и когда нужны детали ответа целиком.

Что приходит на выход

Ответ модели — текстом или разобранным JSON, если запрошена схема, — плюс данные о запросе: провайдер, модель, расход токенов. Сырой ответ включается отдельным параметром, когда нужно посмотреть, что именно вернул сервис.

Ошибки сформулированы по-человечески: провайдер не принимает такой формат файла (и перечень тех, что принимает), модель не умеет смотреть картинки, ответ упёрся в предел токенов. Это те три случая, на которые уходит больше всего времени при отладке.

Как спрашивать, чтобы ответ был полезным

Вопрос к картинке — это половина результата. Несколько приёмов, которые заметно поднимают качество:

  • Спрашивайте о признаках, а не о выводе. Вместо «годится ли фото для карточки» — «белый ли фон, видно ли товар целиком, есть ли посторонние предметы». Вывод потом сделает условие в процессе.
  • Разрешите ответить «не знаю». Прямо в системном промпте: если на фото не разобрать, так и напиши. Иначе модель выберет любой вариант.
  • Ограничьте ответ. «Одно слово», «не больше пятнадцати слов», «только из списка: целое, скол, трещина» — короткий ответ и точнее, и дешевле.
  • Один вопрос — один узел. Пять разных проверок в одном промпте модель смешивает; проще спросить схемой с пятью полями.

Сценарии автоматизации

Проверка фотографий товара

Продавец загружает карточку → узел смотрит фото и отвечает структурой: тот ли это товар, белый ли фон, нет ли посторонних предметов и водяных знаков → карточка уходит на публикацию или возвращается с понятным замечанием.

Приёмка работ по фото

Монтажник присылает фото в бот → модель сверяет снимок с чек-листом: закрыт ли щиток, убран ли мусор, виден ли серийный номер → акт закрывается автоматически или уходит на ручную проверку.

Модерация пользовательских фото

Отзывы с картинками проходят через узел: нет ли на фото запрещённого, есть ли вообще товар. Спорное — человеку, очевидное — сразу в публикацию.

Заявки с фото поломки

Клиент фотографирует технику → модель описывает видимое повреждение и предполагает тип неисправности → заявка создаётся с готовым описанием, а не с одним словом «сломалось».

Описания и alt-тексты

Для каталога или блога по картинке генерируется описание и alt-текст — сразу в CMS, вместе с обложкой, нарисованной соседним узлом.

Полка и витрина

Фото полки из магазина → вопрос «сколько фейсов нашего бренда видно и есть ли пустоты» → отчёт по точкам без ручного обхода.

Чего ждать и чего не ждать

Зрячая модель хорошо описывает сцену и отвечает на вопросы о ней, но у неё есть слабые места, и лучше знать их заранее:

  • Считать она умеет средне. «Сколько коробок на паллете» на плотном фото — вопрос, на котором модели ошибаются; если счёт критичен, просите диапазон и уверенность.
  • Мелкий текст на фото читается хуже, чем в документе: для номеров и этикеток берите кадр покрупнее или узел извлечения из документа.
  • Модель охотно соглашается. На вопрос «это ведь красная куртка?» она чаще ответит «да», чем возразит. Спрашивайте нейтрально: «какого цвета куртка».
  • Ответ — не доказательство. Для решений с деньгами и ответственностью оставляйте человеку последнее слово, а модели — фильтр очевидного.

Сколько это стоит

Картинка стоит токенов, и чем она больше, тем дороже: провайдеры считают изображение по «плиткам». Перед отправкой фото стоит уменьшать до разумного размера — качество ответа от этого обычно не страдает, а счёт заметно меньше.

В Staqflow оплачивается только работа процесса — токены за CPU-секунды, а ожидание ответа провайдера процессор почти не грузит. Тарифы — на странице цен.

Частые вопросы

Какие нейросети умеют смотреть картинки в Staqflow?

Двенадцать провайдеров: OpenAI, Anthropic, Gemini, Qwen, Mistral, Groq, xAI, Perplexity, OpenRouter, Yandex, GigaChat и свой сервер на протоколе OpenAI. Не поддерживает картинки только DeepSeek.

Модель отвечает, что не умеет смотреть изображения

Выбрана не та модель: у большинства провайдеров зрение в отдельных моделях — с vision, vl или omni в названии. Узел подсказывает это прямо в ошибке.

Какие форматы картинок принимаются?

PNG, JPEG, WebP и GIF; у GigaChat — JPEG и PNG. Формат проверяется до отправки, и в ошибке перечислено, что годится.

Можно ли получить ответ структурой, а не текстом?

Да, форматом ответа «JSON по схеме»: описываете нужные поля и получаете их разобранными, готовыми для условий и записи в базу.

Чем это отличается от распознавания документов?

Документная нода берёт PDF и заполняет строгую форму по бланку. Здесь свободный вопрос к картинке — и структура по желанию.

Данные уходят во внешний сервис?

Да, фотография отправляется провайдеру. Если снимки нельзя выпускать наружу — собственный контур и локальная зрячая модель на протоколе OpenAI.

Попробуйте

  1. Создайте аккаунт — карта не нужна.
  2. Соберите процесс из трёх узлов: Telegram-бот с фото, «Анализ изображения» с вопросом и ответ в чат.
  3. Или опишите задачу ИИ-клиенту через MCP: «Проверяй фото товаров: тот ли товар, белый ли фон, нет ли посторонних предметов».

Куда отправить результат — смотрите в каталоге интеграций.