Большие языковые модели кажутся магией: задаёшь вопрос — получаешь связный текст, будто отвечает человек. На деле LLM не понимает смысл так, как мы, а очень точно угадывает следующий токен по всему, что прочитала. Разберём, как именно это работает: от токенов и внимания до обучения и галлюцинаций.
Эта статья — пошаговый разбор того, как LLM превращает ваш запрос в ответ. Без формул, но честно: что такое токен, зачем нужен механизм внимания, как трансформер обрабатывает контекст, чем отличается предобучение от дообучения и почему модели иногда уверенно врут.
Что такое большие языковые модели
Большие языковые модели — это нейросети, обученные на гигантских объёмах текста с одной целью: предсказывать следующий токен. Слово «большие» здесь буквально про размер: миллиарды параметров и терабайты текста в обучении.
Главная идея проста и от этого удивительна. Если научить систему очень хорошо угадывать продолжение любого текста, она невольно выучивает грамматику, факты, стиль и даже зачатки рассуждения — потому что всё это нужно, чтобы угадывать точнее. LLM не хранит ответы в базе; она восстанавливает их из статистики языка.
Именно поэтому одни и те же модели умеют и переводить, и писать код, и пересказывать. Системное большие языковые модели обучение начинается с этого сдвига мышления: LLM — не справочник, а машина предсказания, и работать с ней нужно соответственно.

Токены и эмбеддинги: обработка текста в модели
Модель не видит букв и слов так, как мы. Сначала текст режется на токены — кусочки, которые могут быть целым словом, его частью или знаком. Слово «обучение» может стать одним токеном, а редкое слово — тремя.
Каждый токен превращается в эмбеддинг — длинный список чисел, который кодирует смысл токена в многомерном пространстве. Близкие по смыслу токены оказываются рядом в этом пространстве: «кошка» и «котёнок» ближе друг к другу, чем «кошка» и «трактор». Так модели получают не буквы, а числовое представление смысла.
Понимать токены практически важно: лимит контекста и стоимость запроса считаются именно в токенах, а не в словах. Длинный промпт — это много токенов, и от этого зависит, что модели успеют учесть.
Трансформер, внимание и контекст
Сердце LLM — архитектура трансформер. Её ключевая способность — механизм внимания, который для каждого токена решает, на какие другие токены контекста смотреть и насколько внимательно.
Представьте фразу «он положил книгу на стол, потому что она была тяжёлой». Чтобы понять, к чему относится «она», модель через внимание связывает это слово с «книгой», а не со «столом». Внимание делает это для всех токенов одновременно, поэтому трансформер видит весь контекст целиком, а не читает строго по порядку.
| Этап | Что делает модель | Результат |
|---|---|---|
| Токенизация | Режет текст на токены | Последовательность токенов |
| Эмбеддинг | Кодирует смысл числами | Векторное представление |
| Внимание | Связывает токены контекста | Учёт зависимостей |
| Предсказание | Считает вероятности | Следующий токен |
Именно внимание дало скачок качества: до трансформеров модели быстро «забывали» начало длинного текста. Теперь LLM удерживает связи внутри всего контекстного окна, и от его размера зависит, насколько длинный диалог модели помнят.
Как идёт обучение LLM
Обучение проходит в два больших этапа. Первый — предобучение: модели показывают огромный массив текста и заставляют предсказывать следующий токен снова и снова. Так она впитывает язык, факты и закономерности.
Второй этап — дообучение под инструкции. Сырые предобученные модели умеют продолжать текст, но не обязательно делает то, что просят. Её дообучают на примерах «запрос — хороший ответ» и настраивают на полезность и безопасность с участием людей. После этого LLM начинает вести себя как ассистент, а не как автодополнение.
Галлюцинации и роль промпта
Поскольку LLM предсказывает правдоподобное продолжение, она может уверенно выдать выдумку — это и называют галлюцинацией. Модель не различает «знаю» и «звучит правдоподобно»: для неё это один и тот же процесс предсказания следующего токена.
Снизить риск помогает грамотный промпт. Несколько рабочих приёмов:
- Давать контекст прямо в запросе, а не надеяться на память модели.
- Просить опираться только на приведённый текст и не додумывать.
- Разбивать сложную задачу на шаги, чтобы рассуждение было видимым.
- Проверять факты в ответе там, где цена ошибки высока.
Управление поведением модели через формулировку запроса — отдельный навык. Прикладной промпт инжиниринг для llm курс учит строить запросы так, чтобы получать стабильный результат, а не лотерею из случайных ответов.
Итог: предсказание, а не понимание
LLM не думает в человеческом смысле — она очень хорошо предсказывает следующий токен, опираясь на внимание, контекст и колоссальный объём текста из обучения. Из этой простой механики вырастает впечатляющее поведение, но из неё же растут и галлюцинации.
Понимание этой механики меняет то, как вы работаете с моделью: вы перестаёте ждать от неё истины и начинаете давать ей правильный контекст и точный промпт. Это и есть разница между случайным результатом и предсказуемым.
Частые вопросы
Что такое токен в LLM простыми словами?
Токен — это кусочек текста, на который модель разбивает запрос: целое слово, его часть или знак. LLM работает не с буквами и не со словами, а с последовательностью токенов. В токенах же считаются лимит контекста и стоимость запроса, поэтому длинный промпт — это просто много токенов.
Понимает ли LLM смысл текста?
Не так, как человек. Модель не обладает сознанием и не «знает» факты — она предсказывает наиболее вероятное продолжение на основе обучения. Это выглядит как понимание, потому что для точного предсказания приходится учитывать грамматику, контекст и закономерности языка, но в основе лежит статистика, а не осмысление.
Почему модель иногда выдумывает факты?
Это явление называют галлюцинацией. LLM всегда стремится выдать правдоподобное продолжение и не отличает достоверное от выдуманного — для неё это один процесс предсказания токена. Снизить риск помогают контекст прямо в промпте и проверка ответа там, где ошибка дорого стоит.
Что такое механизм внимания?
Внимание — это часть архитектуры трансформер, которая для каждого токена решает, на какие другие токены смотреть и насколько важно. Благодаря ему модель видит весь контекст сразу и правильно связывает слова между собой, даже если они стоят далеко друг от друга в тексте.
Знает ли LLM свежие новости?
Сама по себе — нет. Знания модели заморожены на момент обучения, новых фактов после релиза она не получает. Чтобы дать ей актуальную информацию, её передают прямо в запросе или подключают внешний поиск. Без этого LLM отвечает только по тому, что видела в обучении.
- LLM — это языковые модели, которые предсказывают следующий токен, опираясь на огромный объём прочитанного текста.
- Текст превращается в токены и эмбеддинги, а механизм внимания решает, какие токены важны для предсказания следующего.
- Архитектура трансформер позволяет модели смотреть на весь контекст сразу, а не читать строго слева направо.
- Обучение идёт в два этапа: предобучение на массиве текста и дообучение под инструкции и безопасность.
- LLM не знает фактов и иногда выдаёт галлюцинации, поэтому грамотный промпт и проверка ответа критичны для результата.
