Большая языковая модель (LLM, large language model) — это не база знаний и не «ИИ, который понимает текст» в человеческом смысле. Это статистическая система, которая предсказывает следующее слово в последовательности, опираясь на закономерности, извлечённые из огромного массива текстов. Этого простого принципа достаточно, чтобы объяснить и то, на что модели способны, и то, почему они иногда ошибаются.

Токены, а не слова

Модель не видит текст так, как видим его мы. Перед обработкой текст разбивается на токены — куски слов или отдельные символы. Слово «искусственный» может превратиться в два-три токена, а короткое «и» — остаться одним целым. Все вычисления модели происходят именно над токенами: объём контекста, который модель «помнит» в разговоре, измеряется не словами, а токенами, и это одна из причин, почему длинные диалоги со временем «теряют» детали из начала.

Обучение: предсказание следующего токена

На этапе предобучения модель миллионы раз решает одну и ту же задачу: по куску текста предсказать, какой токен идёт следующим. Делая это на огромном объёме данных — книги, статьи, код, диалоги, — модель постепенно выстраивает внутри себя статистические представления о языке, фактах и логических связях. Никто не закладывает в неё правила грамматики или факты напрямую: всё это — побочный продукт задачи предсказания.

После предобучения модель дополнительно дообучают — чтобы она лучше следовала инструкциям и отвечала в формате диалога, а не просто продолжала текст. Этот этап обычно называют alignment или instruction tuning, и именно он превращает «предсказатель текста» в помощника, с которым можно разговаривать.

Почему модели «галлюцинируют»

Галлюцинация — это когда модель уверенно выдаёт неверную информацию. Происходит это не потому, что модель «обманывает» или «не знает» в человеческом смысле, а потому что она оптимизирована выдавать правдоподобное продолжение текста, а не проверенный факт. Если в обучающих данных не было точного ответа, модель всё равно выдаст наиболее вероятную по форме последовательность токенов — и она может быть абсолютно неверной по содержанию.

Модель не «знает», что она не знает. Она просто продолжает текст так, как это обычно происходит в похожих контекстах.

Именно поэтому для задач, где важна фактическая точность — работа с документами компании, юридические или медицинские вопросы, — модели всё чаще подключают к внешним источникам данных через технологию RAG (retrieval-augmented generation), о которой мы отдельно рассказываем в статье про работу ИИ со своими данными.

Что значит «контекстное окно»

Контекстное окно — это максимальный объём текста (в токенах), который модель может учитывать одновременно: и то, что вы написали, и всю историю диалога, и собственный ответ по мере генерации. У современных моделей это окно выросло с нескольких тысяч токенов до сотен тысяч — это и позволило появиться AI-агентам, которые удерживают в памяти длинные цепочки действий.

Главное