Большая языковая модель (LLM, large language model) — это не база знаний и не «ИИ, который понимает текст» в человеческом смысле. Это статистическая система, которая предсказывает следующее слово в последовательности, опираясь на закономерности, извлечённые из огромного массива текстов. Этого простого принципа достаточно, чтобы объяснить и то, на что модели способны, и то, почему они иногда ошибаются.
Токены, а не слова
Модель не видит текст так, как видим его мы. Перед обработкой текст разбивается на токены — куски слов или отдельные символы. Слово «искусственный» может превратиться в два-три токена, а короткое «и» — остаться одним целым. Все вычисления модели происходят именно над токенами: объём контекста, который модель «помнит» в разговоре, измеряется не словами, а токенами, и это одна из причин, почему длинные диалоги со временем «теряют» детали из начала.
Обучение: предсказание следующего токена
На этапе предобучения модель миллионы раз решает одну и ту же задачу: по куску текста предсказать, какой токен идёт следующим. Делая это на огромном объёме данных — книги, статьи, код, диалоги, — модель постепенно выстраивает внутри себя статистические представления о языке, фактах и логических связях. Никто не закладывает в неё правила грамматики или факты напрямую: всё это — побочный продукт задачи предсказания.
После предобучения модель дополнительно дообучают — чтобы она лучше следовала инструкциям и отвечала в формате диалога, а не просто продолжала текст. Этот этап обычно называют alignment или instruction tuning, и именно он превращает «предсказатель текста» в помощника, с которым можно разговаривать.
Почему модели «галлюцинируют»
Галлюцинация — это когда модель уверенно выдаёт неверную информацию. Происходит это не потому, что модель «обманывает» или «не знает» в человеческом смысле, а потому что она оптимизирована выдавать правдоподобное продолжение текста, а не проверенный факт. Если в обучающих данных не было точного ответа, модель всё равно выдаст наиболее вероятную по форме последовательность токенов — и она может быть абсолютно неверной по содержанию.
Модель не «знает», что она не знает. Она просто продолжает текст так, как это обычно происходит в похожих контекстах.
Именно поэтому для задач, где важна фактическая точность — работа с документами компании, юридические или медицинские вопросы, — модели всё чаще подключают к внешним источникам данных через технологию RAG (retrieval-augmented generation), о которой мы отдельно рассказываем в статье про работу ИИ со своими данными.
Что значит «контекстное окно»
Контекстное окно — это максимальный объём текста (в токенах), который модель может учитывать одновременно: и то, что вы написали, и всю историю диалога, и собственный ответ по мере генерации. У современных моделей это окно выросло с нескольких тысяч токенов до сотен тысяч — это и позволило появиться AI-агентам, которые удерживают в памяти длинные цепочки действий.
Главное
- LLM предсказывает следующий токен на основе статистических закономерностей, а не «понимает» текст как человек.
- Обучение состоит из двух этапов: предобучение на огромном корпусе текста и дообучение для следования инструкциям.
- Галлюцинации — не баг, а естественное следствие того, как устроена генерация текста.
- Для задач, где нужна точность, модель стоит подключать к проверенным источникам данных, а не полагаться только на «память» модели.