Что такое контекст

Всё, что модель учитывает, отвечая вам, должно одновременно помещаться в её рабочее окно: ваш вопрос, приложенные файлы, вся предыдущая переписка и её собственные прошлые ответы.

Это не память в человеческом смысле. Это скорее стол ограниченной площади: кладёте новые бумаги — старые вытесняются с края. Ничего не «забывается» постепенно, просто выпадает за границу.

Сколько это на практике

Размер измеряется в токенах — кусочках примерно в 3-4 символа. Переводить их в страницы можно грубо: миллион токенов — это сотни страниц обычного текста, десятки тысяч строк таблицы.

ЗадачаЧто нужно
Обычный вопрос-ответЛюбая модель
Разбор статьи на 5 страницЛюбая современная модель
Договор с приложениямиМодель с большим окном
Дипломная работа целикомБольшое окно, например Gemini 3.1 Pro
Многочасовая расшифровкаБольшое окно или разбиение на части

Полный список моделей с их характеристиками — на странице моделей.

Почему длинный диалог портится

Три причины, и они складываются.

Вытеснение: начало разговора уехало со стола, и модель отвечает, не видя ваших первых уточнений.

Накопление шума: в контексте лежат все ваши неудачные попытки и её неудачные ответы, и они тоже влияют на продолжение.

Дрейф: каждый следующий ответ опирается на предыдущий, и мелкие отклонения накапливаются, как в игре в испорченный телефон.

Отсюда простое правило: если разговор ушёл в сторону и правки не помогают — начните новый чат и сформулируйте задачу заново, с учётом того, что уже поняли.

Четыре приёма для больших документов

Повторяйте важное. Ключевые условия и требования стоит повторить в текущем сообщении, а не рассчитывать, что они «помнятся» с двадцатого сообщения назад.

Сжимайте по ходу. «Собери в 10 пунктов всё, о чём мы договорились» — и дальше работайте с этим конспектом в новом чате. Контекст очищается, суть остаётся.

Разбивайте по смыслу, а не по объёму. Документ, разрезанный посередине мысли, даёт худший разбор, чем поделённый по главам.

Агрегируйте данные заранее. Для вопроса о помесячной динамике не нужны все сорок тысяч строк выгрузки — достаточно свода по месяцам. Это и точнее, и дешевле.

Работать удобно в чате. Попробовать можно на ГПТ Россия: новичку начисляется приветственный бонус 50 ₽, сервис работает без VPN, оплата в рублях российской картой.

Контекст и деньги

Вы платите за токены — и входные тоже. Значит, каждый лишний килобайт в контексте стоит денег на каждом сообщении, потому что вся переписка отправляется заново при каждом обращении.

Практическая экономия: не тащите в разговор документы, которые больше не нужны; для новой задачи начинайте новый чат; длинные данные агрегируйте до отправки.

Для потоковых сценариев это становится заметной статьёй расходов — разбор в гайде про API.

Между разговорами памяти нет

Каждый новый чат начинается с чистого стола: модель не помнит, что вы обсуждали вчера, и не знает ничего о вас, если вы сами не расскажете.

Практический приём для регулярных задач: держите короткий текст с вводными о себе и своей работе и вставляйте его в начало нового разговора. Пять строк контекста заметно повышают качество ответов и стоят копейки.

Частые вопросы

Что происходит, если документ не помещается?

Модель либо вернёт ошибку, либо обработает то, что влезло, — и второй случай опаснее, потому что ответ выглядит полным. Для больших файлов заранее выбирайте модель с подходящим окном или делите документ сами.

Правда ли, что большой контекст всегда лучше?

Нет. Чем больше в контексте посторонних данных, тем выше шанс, что модель зацепится не за то. Точный короткий контекст обычно даёт лучший ответ, чем «загрузим всё, вдруг пригодится».

Почему модель путает детали в конце длинного разбора?

Внимание распределяется по всему окну неравномерно: середина длинного документа проработана слабее, чем начало и конец. Если важна деталь из середины — вынесите её в вопрос отдельно.