Большие языковые модели LLM — токены и контекст

Обновлено: 12 июня 2026 · чтение ~7 мин.

Большие языковые модели кажутся магией: задаёшь вопрос — получаешь связный текст, будто отвечает человек. На деле LLM не понимает смысл так, как мы, а очень точно угадывает следующий токен по всему, что прочитала. Разберём, как именно это работает: от токенов и внимания до обучения и галлюцинаций.

Эта статья — пошаговый разбор того, как LLM превращает ваш запрос в ответ. Без формул, но честно: что такое токен, зачем нужен механизм внимания, как трансформер обрабатывает контекст, чем отличается предобучение от дообучения и почему модели иногда уверенно врут.

Что такое большие языковые модели

Большие языковые модели — это нейросети, обученные на гигантских объёмах текста с одной целью: предсказывать следующий токен. Слово «большие» здесь буквально про размер: миллиарды параметров и терабайты текста в обучении.

Главная идея проста и от этого удивительна. Если научить систему очень хорошо угадывать продолжение любого текста, она невольно выучивает грамматику, факты, стиль и даже зачатки рассуждения — потому что всё это нужно, чтобы угадывать точнее. LLM не хранит ответы в базе; она восстанавливает их из статистики языка.

Именно поэтому одни и те же модели умеют и переводить, и писать код, и пересказывать. Системное большие языковые модели обучение начинается с этого сдвига мышления: LLM — не справочник, а машина предсказания, и работать с ней нужно соответственно.

Абстрактная сеть светящихся узлов — внимание и связи между токенами внутри модели

Токены и эмбеддинги: обработка текста в модели

Модель не видит букв и слов так, как мы. Сначала текст режется на токены — кусочки, которые могут быть целым словом, его частью или знаком. Слово «обучение» может стать одним токеном, а редкое слово — тремя.

Каждый токен превращается в эмбеддинг — длинный список чисел, который кодирует смысл токена в многомерном пространстве. Близкие по смыслу токены оказываются рядом в этом пространстве: «кошка» и «котёнок» ближе друг к другу, чем «кошка» и «трактор». Так модели получают не буквы, а числовое представление смысла.

Понимать токены практически важно: лимит контекста и стоимость запроса считаются именно в токенах, а не в словах. Длинный промпт — это много токенов, и от этого зависит, что модели успеют учесть.

Трансформер, внимание и контекст

Сердце LLM — архитектура трансформер. Её ключевая способность — механизм внимания, который для каждого токена решает, на какие другие токены контекста смотреть и насколько внимательно.

Представьте фразу «он положил книгу на стол, потому что она была тяжёлой». Чтобы понять, к чему относится «она», модель через внимание связывает это слово с «книгой», а не со «столом». Внимание делает это для всех токенов одновременно, поэтому трансформер видит весь контекст целиком, а не читает строго по порядку.

Путь от текста к ответу внутри трансформер-модели LLM
ЭтапЧто делает модельРезультат
ТокенизацияРежет текст на токеныПоследовательность токенов
ЭмбеддингКодирует смысл числамиВекторное представление
ВниманиеСвязывает токены контекстаУчёт зависимостей
ПредсказаниеСчитает вероятностиСледующий токен

Именно внимание дало скачок качества: до трансформеров модели быстро «забывали» начало длинного текста. Теперь LLM удерживает связи внутри всего контекстного окна, и от его размера зависит, насколько длинный диалог модели помнят.

Как идёт обучение LLM

Обучение проходит в два больших этапа. Первый — предобучение: модели показывают огромный массив текста и заставляют предсказывать следующий токен снова и снова. Так она впитывает язык, факты и закономерности.

Второй этап — дообучение под инструкции. Сырые предобученные модели умеют продолжать текст, но не обязательно делает то, что просят. Её дообучают на примерах «запрос — хороший ответ» и настраивают на полезность и безопасность с участием людей. После этого LLM начинает вести себя как ассистент, а не как автодополнение.

Важно понимать: модель не «учит» свежие факты после релиза. Её знания заморожены на момент обучения. Если нужна актуальная информация, её подают прямо в промпт или подключают поиск — сама по себе LLM новых данных не получает и честно об этом не знает.

Галлюцинации и роль промпта

Поскольку LLM предсказывает правдоподобное продолжение, она может уверенно выдать выдумку — это и называют галлюцинацией. Модель не различает «знаю» и «звучит правдоподобно»: для неё это один и тот же процесс предсказания следующего токена.

Снизить риск помогает грамотный промпт. Несколько рабочих приёмов:

  • Давать контекст прямо в запросе, а не надеяться на память модели.
  • Просить опираться только на приведённый текст и не додумывать.
  • Разбивать сложную задачу на шаги, чтобы рассуждение было видимым.
  • Проверять факты в ответе там, где цена ошибки высока.

Управление поведением модели через формулировку запроса — отдельный навык. Прикладной промпт инжиниринг для llm курс учит строить запросы так, чтобы получать стабильный результат, а не лотерею из случайных ответов.

Итог: предсказание, а не понимание

LLM не думает в человеческом смысле — она очень хорошо предсказывает следующий токен, опираясь на внимание, контекст и колоссальный объём текста из обучения. Из этой простой механики вырастает впечатляющее поведение, но из неё же растут и галлюцинации.

Понимание этой механики меняет то, как вы работаете с моделью: вы перестаёте ждать от неё истины и начинаете давать ей правильный контекст и точный промпт. Это и есть разница между случайным результатом и предсказуемым.

Частые вопросы

Что такое токен в LLM простыми словами?

Токен — это кусочек текста, на который модель разбивает запрос: целое слово, его часть или знак. LLM работает не с буквами и не со словами, а с последовательностью токенов. В токенах же считаются лимит контекста и стоимость запроса, поэтому длинный промпт — это просто много токенов.

Понимает ли LLM смысл текста?

Не так, как человек. Модель не обладает сознанием и не «знает» факты — она предсказывает наиболее вероятное продолжение на основе обучения. Это выглядит как понимание, потому что для точного предсказания приходится учитывать грамматику, контекст и закономерности языка, но в основе лежит статистика, а не осмысление.

Почему модель иногда выдумывает факты?

Это явление называют галлюцинацией. LLM всегда стремится выдать правдоподобное продолжение и не отличает достоверное от выдуманного — для неё это один процесс предсказания токена. Снизить риск помогают контекст прямо в промпте и проверка ответа там, где ошибка дорого стоит.

Что такое механизм внимания?

Внимание — это часть архитектуры трансформер, которая для каждого токена решает, на какие другие токены смотреть и насколько важно. Благодаря ему модель видит весь контекст сразу и правильно связывает слова между собой, даже если они стоят далеко друг от друга в тексте.

Знает ли LLM свежие новости?

Сама по себе — нет. Знания модели заморожены на момент обучения, новых фактов после релиза она не получает. Чтобы дать ей актуальную информацию, её передают прямо в запросе или подключают внешний поиск. Без этого LLM отвечает только по тому, что видела в обучении.

Что в итоге

  • LLM — это языковые модели, которые предсказывают следующий токен, опираясь на огромный объём прочитанного текста.
  • Текст превращается в токены и эмбеддинги, а механизм внимания решает, какие токены важны для предсказания следующего.
  • Архитектура трансформер позволяет модели смотреть на весь контекст сразу, а не читать строго слева направо.
  • Обучение идёт в два этапа: предобучение на массиве текста и дообучение под инструкции и безопасность.
  • LLM не знает фактов и иногда выдаёт галлюцинации, поэтому грамотный промпт и проверка ответа критичны для результата.