Фотографии приходят в бизнес непрерывно: продавец загрузил снимок товара, клиент прислал фото поломки, курьер сфотографировал подъезд, монтажник — готовую работу. С каждым снимком кто-то должен что-то решить: подходит или нет, то это или не то, есть ли на фото то, что обещали.
В Staqflow появился узел «Анализ изображения». Он показывает картинку модели и задаёт ваш вопрос — а дальше процесс работает с ответом как с обычными данными.
Анализ изображения в workflow — это шаг процесса, который передаёт картинку зрячей модели вместе с вопросом и возвращает ответ: текстом или сразу структурой по заданной схеме.
Чем это отличается от распознавания документов
Узел извлечения из документа заточен под бланки: он берёт PDF и заполняет заранее описанную форму. Узел анализа изображения устроен свободнее: ему задают вопрос своими словами — «что на фото», «сколько коробок на паллете», «читается ли номер», «соответствует ли фото описанию товара».
Если ответ нужен структурой, её можно потребовать и здесь — форматом ответа «JSON по схеме».
Двенадцать провайдеров
Зрение есть почти у всех, кого поддерживает платформа: OpenAI, Anthropic, Google Gemini, Qwen, Mistral, Groq, xAI, Perplexity, OpenRouter, Yandex, GigaChat и свой сервер на протоколе OpenAI. Отдельное подключение заводить не нужно — узел работает на том же ключе, что языковая модель.
Из общего списка выпадает только DeepSeek: картинку он не принимает.
Две особенности, которые стоит знать заранее:
- Не каждая модель у провайдера — зрячая. Узел скажет об этом прямо: возьмите модель с
vision,vlилиomniв названии. Это не каприз — у большинства провайдеров зрение живёт в отдельных моделях. - GigaChat грузит картинку отдельно и принимает JPEG и PNG; остальные берут картинку прямо в сообщении и понимают PNG, JPEG, WebP и GIF.
Как настроить
- Добавьте подключение к сервису в учётных данных пространства.
- Поставьте узел «Анализ изображения», выберите провайдера и зрячую модель.
- Укажите источник картинки: бинарное поле элемента — фото из Telegram, вложение из почты, файл из хранилища — или ссылка.
- Задайте вопрос. Это обычный текст с выражениями:
На фото должен быть {{ $json.product }}. Это он? - Выберите формат ответа: текст или JSON по схеме.
Системный промпт задаёт роль и правила на все запросы сразу: «отвечай одним словом», «ты приёмщик на складе, проверяй по чек-листу», «если не уверен — так и скажи».
Когда просить JSON
Свободный текст удобен человеку: его отправляют в чат, и там его читают. Процессу удобнее структура — по ней можно ветвиться без разбора строк.
Простой приём: спрашивайте не «что на фото», а «заполни поля» — и описывайте схему с полями вроде matches (да или нет), reason (почему) и defects (список). Дальше узел условия смотрит на matches, и ручной разбор остаётся только для спорных случаев.
Параметры
- Температура — для проверок держите низкой: от модели нужна повторяемость, а не фантазия.
- Предел токенов ответа. Если ответ обрывается, узел прямо скажет: поднимите предел или возьмите модель без длинных размышлений.
- Top P и зерно — тонкая настройка и повторяемость там, где провайдер это умеет.
- Таймаут и сырой ответ — на случай долгих моделей и когда нужны детали ответа целиком.
Что приходит на выход
Ответ модели — текстом или разобранным JSON, если запрошена схема, — плюс данные о запросе: провайдер, модель, расход токенов. Сырой ответ включается отдельным параметром, когда нужно посмотреть, что именно вернул сервис.
Ошибки сформулированы по-человечески: провайдер не принимает такой формат файла (и перечень тех, что принимает), модель не умеет смотреть картинки, ответ упёрся в предел токенов. Это те три случая, на которые уходит больше всего времени при отладке.
Как спрашивать, чтобы ответ был полезным
Вопрос к картинке — это половина результата. Несколько приёмов, которые заметно поднимают качество:
- Спрашивайте о признаках, а не о выводе. Вместо «годится ли фото для карточки» — «белый ли фон, видно ли товар целиком, есть ли посторонние предметы». Вывод потом сделает условие в процессе.
- Разрешите ответить «не знаю». Прямо в системном промпте: если на фото не разобрать, так и напиши. Иначе модель выберет любой вариант.
- Ограничьте ответ. «Одно слово», «не больше пятнадцати слов», «только из списка: целое, скол, трещина» — короткий ответ и точнее, и дешевле.
- Один вопрос — один узел. Пять разных проверок в одном промпте модель смешивает; проще спросить схемой с пятью полями.
Сценарии автоматизации
Проверка фотографий товара
Продавец загружает карточку → узел смотрит фото и отвечает структурой: тот ли это товар, белый ли фон, нет ли посторонних предметов и водяных знаков → карточка уходит на публикацию или возвращается с понятным замечанием.
Приёмка работ по фото
Монтажник присылает фото в бот → модель сверяет снимок с чек-листом: закрыт ли щиток, убран ли мусор, виден ли серийный номер → акт закрывается автоматически или уходит на ручную проверку.
Модерация пользовательских фото
Отзывы с картинками проходят через узел: нет ли на фото запрещённого, есть ли вообще товар. Спорное — человеку, очевидное — сразу в публикацию.
Заявки с фото поломки
Клиент фотографирует технику → модель описывает видимое повреждение и предполагает тип неисправности → заявка создаётся с готовым описанием, а не с одним словом «сломалось».
Описания и alt-тексты
Для каталога или блога по картинке генерируется описание и alt-текст — сразу в CMS, вместе с обложкой, нарисованной соседним узлом.
Полка и витрина
Фото полки из магазина → вопрос «сколько фейсов нашего бренда видно и есть ли пустоты» → отчёт по точкам без ручного обхода.
Чего ждать и чего не ждать
Зрячая модель хорошо описывает сцену и отвечает на вопросы о ней, но у неё есть слабые места, и лучше знать их заранее:
- Считать она умеет средне. «Сколько коробок на паллете» на плотном фото — вопрос, на котором модели ошибаются; если счёт критичен, просите диапазон и уверенность.
- Мелкий текст на фото читается хуже, чем в документе: для номеров и этикеток берите кадр покрупнее или узел извлечения из документа.
- Модель охотно соглашается. На вопрос «это ведь красная куртка?» она чаще ответит «да», чем возразит. Спрашивайте нейтрально: «какого цвета куртка».
- Ответ — не доказательство. Для решений с деньгами и ответственностью оставляйте человеку последнее слово, а модели — фильтр очевидного.
Сколько это стоит
Картинка стоит токенов, и чем она больше, тем дороже: провайдеры считают изображение по «плиткам». Перед отправкой фото стоит уменьшать до разумного размера — качество ответа от этого обычно не страдает, а счёт заметно меньше.
В Staqflow оплачивается только работа процесса — токены за CPU-секунды, а ожидание ответа провайдера процессор почти не грузит. Тарифы — на странице цен.
Частые вопросы
Какие нейросети умеют смотреть картинки в Staqflow?
Двенадцать провайдеров: OpenAI, Anthropic, Gemini, Qwen, Mistral, Groq, xAI, Perplexity, OpenRouter, Yandex, GigaChat и свой сервер на протоколе OpenAI. Не поддерживает картинки только DeepSeek.
Модель отвечает, что не умеет смотреть изображения
Выбрана не та модель: у большинства провайдеров зрение в отдельных моделях — с vision, vl или omni в названии. Узел подсказывает это прямо в ошибке.
Какие форматы картинок принимаются?
PNG, JPEG, WebP и GIF; у GigaChat — JPEG и PNG. Формат проверяется до отправки, и в ошибке перечислено, что годится.
Можно ли получить ответ структурой, а не текстом?
Да, форматом ответа «JSON по схеме»: описываете нужные поля и получаете их разобранными, готовыми для условий и записи в базу.
Чем это отличается от распознавания документов?
Документная нода берёт PDF и заполняет строгую форму по бланку. Здесь свободный вопрос к картинке — и структура по желанию.
Данные уходят во внешний сервис?
Да, фотография отправляется провайдеру. Если снимки нельзя выпускать наружу — собственный контур и локальная зрячая модель на протоколе OpenAI.
Попробуйте
- Создайте аккаунт — карта не нужна.
- Соберите процесс из трёх узлов: Telegram-бот с фото, «Анализ изображения» с вопросом и ответ в чат.
- Или опишите задачу ИИ-клиенту через MCP: «Проверяй фото товаров: тот ли товар, белый ли фон, нет ли посторонних предметов».
Куда отправить результат — смотрите в каталоге интеграций.
