Как работает промпт с картинкой на входе
Мультимодальный промпт — это картинка плюс текстовый вопрос в одном сообщении: вы загружаете в чат скриншот, схему или фото, а модель «смотрит» на изображение и отвечает по его содержимому. Не нужно ничего перепечатывать: таблица с фото, ошибка на скриншоте, чертёж, страница договора — модель извлекает данные прямо из пикселей. Что такое мультимодальность технически — коротко объяснено в глоссарии, в статье про мультимодальные модели.
Ключевое правило: картинка без вопроса — бесполезна. Модель опишет изображение «в общем», а вам нужен конкретный ответ. Поэтому формула всегда одна: изображение + роль + конкретный вопрос + формат ответа.
Что можно спрашивать: 7 рабочих сценариев
- Скриншот ошибки: «на скрине — ошибка при установке программы; объясни причину и дай шаги исправления по порядку».
- Таблица или график с фото: «извлеки данные из таблицы на фото в markdown-таблицу, ничего не придумывай, нечитаемые ячейки помечай знаком ?».
- Схема или чертёж: «объясни, как работает система на этой схеме, простыми словами для новичка».
- Документ: «это страница договора аренды; выпиши пункты про штрафы и досрочное расторжение с номерами пунктов».
- Учебная задача: «на фото — задача по геометрии; реши с объяснением каждого шага, как для восьмиклассника».
- Интерфейс: «вот скриншот настроек роутера; где включить гостевую сеть — укажи, куда нажимать».
- Чек или квитанция: «разнеси позиции с чека по категориям расходов и посчитай итог по каждой».
Общий приём — попросить модель сначала «прочитать» изображение вслух: «сначала перечисли всё, что видишь на скрине, затем отвечай». Это снижает риск, что модель проглядит мелкую, но важную деталь.
Структура сильного мультимодального промпта
| Слот | Зачем | Пример |
|---|---|---|
| Что на картинке | задать контекст | «это скриншот личного кабинета банка» |
| Роль модели | включить нужную экспертизу | «ты — техподдержка» |
| Конкретный вопрос | сузить фокус | «почему платёж в статусе "отклонён"?» |
| Формат ответа | получить применимый результат | «шаги списком, без воды» |
| Ограничение честности | защита от фантазий | «если данных на скрине не хватает — скажи, чего не хватает» |
Последний слот — самый важный при работе с документами и цифрами. Модель склонна «дочитывать» размытые участки; фраза «не придумывай, помечай нечитаемое» заметно повышает достоверность. Для многостраничных документов работает серия сообщений в одном диалоге: загружаете страницы по очереди, а в конце просите общий вывод — контекст диалога сохраняется.
Какие модели понимают картинки лучше
Изображения на входе принимает большинство флагманских чат-моделей каталога: GPT-5.5, Claude Sonnet 5, Gemini 3.1 Pro. Для разбора схем, длинных документов и скриншотов с мелким текстом сильный выбор — Gemini 3.1 Pro: у неё контекст около миллиона токенов, в один диалог помещается целая пачка страниц с вопросами. Для быстрых бытовых сценариев — «что это за ошибка», «переведи вывеску с фото» — достаточно и Gemini 3.5 Flash.
Попробовать проще всего в чате на странице генерации текста: прикрепите изображение к сообщению и задайте вопрос. Оплата — за фактическое использование, а новичку «ГПТ Россия» начисляет 50 ₽ приветственного баланса — хватит на десятки разборов скриншотов. Без VPN, оплата российской картой.
Частые вопросы
Сколько картинок можно отправить в одном диалоге?
Несколько — и это удобно для сравнения: «на первом скрине настройки до, на втором после; что изменилось?» Помните, что каждая картинка расходует токены контекста, поэтому для очень длинных серий берите модели с большим контекстом вроде Gemini 3.1 Pro.
Распознаёт ли модель рукописный текст на фото?
Разборчивый почерк — да: конспекты, записки, подписи на схемах читаются уверенно. На неразборчивых участках модель может ошибаться, поэтому всегда добавляйте ограничение «нечитаемое помечай, не угадывай» и проверяйте критичные цифры глазами.
Можно ли загрузить фото человека и спросить, кто это?
Модели не идентифицируют личности по лицу — это ограничение контент-политики вендоров. По фото человека можно спрашивать о нейтральных вещах: стиль одежды, эпоха на архивном снимке, композиция кадра.



