Как работает промпт с картинкой на входе

Мультимодальный промпт — это картинка плюс текстовый вопрос в одном сообщении: вы загружаете в чат скриншот, схему или фото, а модель «смотрит» на изображение и отвечает по его содержимому. Не нужно ничего перепечатывать: таблица с фото, ошибка на скриншоте, чертёж, страница договора — модель извлекает данные прямо из пикселей. Что такое мультимодальность технически — коротко объяснено в глоссарии, в статье про мультимодальные модели.

Ключевое правило: картинка без вопроса — бесполезна. Модель опишет изображение «в общем», а вам нужен конкретный ответ. Поэтому формула всегда одна: изображение + роль + конкретный вопрос + формат ответа.

Что можно спрашивать: 7 рабочих сценариев

  1. Скриншот ошибки: «на скрине — ошибка при установке программы; объясни причину и дай шаги исправления по порядку».
  2. Таблица или график с фото: «извлеки данные из таблицы на фото в markdown-таблицу, ничего не придумывай, нечитаемые ячейки помечай знаком ?».
  3. Схема или чертёж: «объясни, как работает система на этой схеме, простыми словами для новичка».
  4. Документ: «это страница договора аренды; выпиши пункты про штрафы и досрочное расторжение с номерами пунктов».
  5. Учебная задача: «на фото — задача по геометрии; реши с объяснением каждого шага, как для восьмиклассника».
  6. Интерфейс: «вот скриншот настроек роутера; где включить гостевую сеть — укажи, куда нажимать».
  7. Чек или квитанция: «разнеси позиции с чека по категориям расходов и посчитай итог по каждой».

Общий приём — попросить модель сначала «прочитать» изображение вслух: «сначала перечисли всё, что видишь на скрине, затем отвечай». Это снижает риск, что модель проглядит мелкую, но важную деталь.

Структура сильного мультимодального промпта

СлотЗачемПример
Что на картинкезадать контекст«это скриншот личного кабинета банка»
Роль моделивключить нужную экспертизу«ты — техподдержка»
Конкретный вопроссузить фокус«почему платёж в статусе "отклонён"?»
Формат ответаполучить применимый результат«шаги списком, без воды»
Ограничение честностизащита от фантазий«если данных на скрине не хватает — скажи, чего не хватает»

Последний слот — самый важный при работе с документами и цифрами. Модель склонна «дочитывать» размытые участки; фраза «не придумывай, помечай нечитаемое» заметно повышает достоверность. Для многостраничных документов работает серия сообщений в одном диалоге: загружаете страницы по очереди, а в конце просите общий вывод — контекст диалога сохраняется.

Какие модели понимают картинки лучше

Изображения на входе принимает большинство флагманских чат-моделей каталога: GPT-5.5, Claude Sonnet 5, Gemini 3.1 Pro. Для разбора схем, длинных документов и скриншотов с мелким текстом сильный выбор — Gemini 3.1 Pro: у неё контекст около миллиона токенов, в один диалог помещается целая пачка страниц с вопросами. Для быстрых бытовых сценариев — «что это за ошибка», «переведи вывеску с фото» — достаточно и Gemini 3.5 Flash.

Попробовать проще всего в чате на странице генерации текста: прикрепите изображение к сообщению и задайте вопрос. Оплата — за фактическое использование, а новичку «ГПТ Россия» начисляет 50 ₽ приветственного баланса — хватит на десятки разборов скриншотов. Без VPN, оплата российской картой.

Частые вопросы

Сколько картинок можно отправить в одном диалоге?

Несколько — и это удобно для сравнения: «на первом скрине настройки до, на втором после; что изменилось?» Помните, что каждая картинка расходует токены контекста, поэтому для очень длинных серий берите модели с большим контекстом вроде Gemini 3.1 Pro.

Распознаёт ли модель рукописный текст на фото?

Разборчивый почерк — да: конспекты, записки, подписи на схемах читаются уверенно. На неразборчивых участках модель может ошибаться, поэтому всегда добавляйте ограничение «нечитаемое помечай, не угадывай» и проверяйте критичные цифры глазами.

Можно ли загрузить фото человека и спросить, кто это?

Модели не идентифицируют личности по лицу — это ограничение контент-политики вендоров. По фото человека можно спрашивать о нейтральных вещах: стиль одежды, эпоха на архивном снимке, композиция кадра.