Что такое контекст
Всё, что модель учитывает, отвечая вам, должно одновременно помещаться в её рабочее окно: ваш вопрос, приложенные файлы, вся предыдущая переписка и её собственные прошлые ответы.
Это не память в человеческом смысле. Это скорее стол ограниченной площади: кладёте новые бумаги — старые вытесняются с края. Ничего не «забывается» постепенно, просто выпадает за границу.
Сколько это на практике
Размер измеряется в токенах — кусочках примерно в 3-4 символа. Переводить их в страницы можно грубо: миллион токенов — это сотни страниц обычного текста, десятки тысяч строк таблицы.
| Задача | Что нужно |
|---|---|
| Обычный вопрос-ответ | Любая модель |
| Разбор статьи на 5 страниц | Любая современная модель |
| Договор с приложениями | Модель с большим окном |
| Дипломная работа целиком | Большое окно, например Gemini 3.1 Pro |
| Многочасовая расшифровка | Большое окно или разбиение на части |
Полный список моделей с их характеристиками — на странице моделей.
Почему длинный диалог портится
Три причины, и они складываются.
Вытеснение: начало разговора уехало со стола, и модель отвечает, не видя ваших первых уточнений.
Накопление шума: в контексте лежат все ваши неудачные попытки и её неудачные ответы, и они тоже влияют на продолжение.
Дрейф: каждый следующий ответ опирается на предыдущий, и мелкие отклонения накапливаются, как в игре в испорченный телефон.
Отсюда простое правило: если разговор ушёл в сторону и правки не помогают — начните новый чат и сформулируйте задачу заново, с учётом того, что уже поняли.
Четыре приёма для больших документов
Повторяйте важное. Ключевые условия и требования стоит повторить в текущем сообщении, а не рассчитывать, что они «помнятся» с двадцатого сообщения назад.
Сжимайте по ходу. «Собери в 10 пунктов всё, о чём мы договорились» — и дальше работайте с этим конспектом в новом чате. Контекст очищается, суть остаётся.
Разбивайте по смыслу, а не по объёму. Документ, разрезанный посередине мысли, даёт худший разбор, чем поделённый по главам.
Агрегируйте данные заранее. Для вопроса о помесячной динамике не нужны все сорок тысяч строк выгрузки — достаточно свода по месяцам. Это и точнее, и дешевле.
Работать удобно в чате. Попробовать можно на ГПТ Россия: новичку начисляется приветственный бонус 50 ₽, сервис работает без VPN, оплата в рублях российской картой.
Контекст и деньги
Вы платите за токены — и входные тоже. Значит, каждый лишний килобайт в контексте стоит денег на каждом сообщении, потому что вся переписка отправляется заново при каждом обращении.
Практическая экономия: не тащите в разговор документы, которые больше не нужны; для новой задачи начинайте новый чат; длинные данные агрегируйте до отправки.
Для потоковых сценариев это становится заметной статьёй расходов — разбор в гайде про API.
Между разговорами памяти нет
Каждый новый чат начинается с чистого стола: модель не помнит, что вы обсуждали вчера, и не знает ничего о вас, если вы сами не расскажете.
Практический приём для регулярных задач: держите короткий текст с вводными о себе и своей работе и вставляйте его в начало нового разговора. Пять строк контекста заметно повышают качество ответов и стоят копейки.
Частые вопросы
Что происходит, если документ не помещается?
Модель либо вернёт ошибку, либо обработает то, что влезло, — и второй случай опаснее, потому что ответ выглядит полным. Для больших файлов заранее выбирайте модель с подходящим окном или делите документ сами.
Правда ли, что большой контекст всегда лучше?
Нет. Чем больше в контексте посторонних данных, тем выше шанс, что модель зацепится не за то. Точный короткий контекст обычно даёт лучший ответ, чем «загрузим всё, вдруг пригодится».
Почему модель путает детали в конце длинного разбора?
Внимание распределяется по всему окну неравномерно: середина длинного документа проработана слабее, чем начало и конец. Если важна деталь из середины — вынесите её в вопрос отдельно.



