Что такое LLM (большая языковая модель) простыми словами
LLM (large language model, большая языковая модель) — это нейросеть, обученная на огромном массиве текстов, которая умеет продолжать текст: отвечать на вопросы, писать, переводить, пересказывать, извлекать данные из документов и писать код. На LLM работают ChatGPT, Claude, Gemini, DeepSeek, GigaChat и Алиса AI. Если совсем коротко, LLM — это очень продвинутое автодополнение, которое за годы обучения «прочитало» больше текстов, чем любой человек за жизнь.
Статья для руководителей и собственников, которые слышат «LLM» на каждой планёрке и хотят понимать, что стоит за словом: как модель устроена, чему её можно доверить, во что обходится её использование и когда её имеет смысл ставить на свой сервер. Без формул — на аналогиях.
Что такое LLM простыми словами
Представьте стажёра, который прочитал весь интернет, миллионы книг, документацию и форумы программистов, но ни дня не работал в вашей компании. Он бегло пишет на любую тему, хорошо формулирует, быстро разбирается в незнакомом тексте, но не знает ваших цен, регламентов и клиентов — и иногда, чтобы не молчать, уверенно сочиняет. Это и есть LLM.
Расшифровка аббревиатуры:
- Large — большая: у современных моделей от единиц до сотен миллиардов (а у крупнейших — больше триллиона) параметров, обучали их на триллионах слов;
- Language — языковая: модель работает с текстом (и с тем, что можно в текст превратить: код, таблицы, а у мультимодальных моделей — ещё изображения и звук);
- Model — модель: математическая функция, которая по входному тексту вычисляет вероятности следующего фрагмента.
В ИТ под LLM обычно понимают именно генеративные модели вроде GPT. Есть и «понимающие» языковые модели (классический пример — BERT), которые не пишут тексты, а классифицируют и ищут; они часто работают незаметно внутри поисковиков и корпоративных систем.
LLM, нейросеть, ИИ и ChatGPT: в чём разница
Эти слова путают даже в презентациях подрядчиков, поэтому зафиксируем иерархию:
| Термин | Что это | Пример |
|---|---|---|
| Искусственный интеллект | Зонтичное понятие для всех систем, имитирующих интеллектуальные задачи | Распознавание лиц, рекомендации, LLM |
| Нейросеть | Метод машинного обучения, один из инструментов ИИ | Сеть, отличающая брак на конвейере |
| LLM | Нейросеть для работы с языком — «движок» | GPT, Claude, Qwen, GigaChat |
| Чат-продукт | Интерфейс поверх одной или нескольких LLM | ChatGPT, Алиса AI, giga.chat |
| API модели | Способ обращаться к LLM из своего кода, минуя чат | Интеграция с CRM, ботом, сайтом |
Практический смысл: «подключить ChatGPT» и «внедрить LLM в процесс» — разные задачи. Первое — это подписка для сотрудников, второе — разработка, где модель через API получает данные из ваших систем и возвращает результат в них.
Как работает большая языковая модель
Токены: из чего модель «видит» текст
Модель не читает буквы и слова в привычном смысле. Перед обработкой текст режется на токены — фрагменты: частое слово целиком, кусок длинного слова, знак препинания. Слово «страхование» может превратиться в два-три токена. Русский текст обычно дробится мельче английского, поэтому тот же смысл по-русски «весит» больше токенов.
Для бизнеса токен — это прежде всего единица оплаты. Провайдеры считают не запросы и не символы, а токены, причём отдельно входные (ваш запрос вместе с документами) и выходные (ответ модели), и выходные почти всегда в несколько раз дороже.
Предсказание следующего токена
Ответ рождается по одному токену. Модель смотрит на весь текст перед собой и вычисляет, какой токен вероятнее всего идёт дальше; дописывает его, снова смотрит на весь текст — и так тысячи раз подряд. Поэтому в чатах ответ «печатается» на глазах, а не появляется целиком.
Насколько смело модель выбирает продолжение, регулирует параметр температуры. При низкой она почти всегда берёт самый вероятный вариант — ответы стабильные и предсказуемые, это нужно для извлечения данных и классификации. При высокой допускает менее вероятные варианты — текст живее, но и ошибок больше.
Трансформер и механизм внимания
Почти все современные LLM построены на архитектуре трансформер (её предложили исследователи Google в 2017 году в статье «Attention Is All You Need»). Её ключевая идея — механизм внимания: обрабатывая каждое слово, модель «оглядывается» на все остальные слова текста и решает, какие из них важны для смысла прямо сейчас.
Аналогия: в фразе «Договор подписал директор, но он не поставил печать» человек сразу понимает, что «он» — это директор. Механизм внимания делает то же самое: связывает «он» с «директором», «печать» — с «договором». Старые нейросети читали текст строго по порядку и к концу абзаца «забывали» начало, трансформер видит весь фрагмент одновременно. Именно это позволило обучать модели на гигантских объёмах данных параллельно на тысячах видеокарт — и привело к скачку качества.
Как обучают LLM: три этапа
- Предобучение (pre-training). Модели показывают триллионы токенов текста — сайты, книги, код, научные статьи — и учат угадывать следующий токен. На этом этапе она усваивает грамматику, факты, стиль, логику рассуждений. Это самый дорогой этап: месяцы работы тысяч GPU. Результат — «базовая модель», которая умеет продолжать текст, но не умеет вести диалог и выполнять просьбы.
- Дообучение на инструкциях (fine-tuning). Базовую модель дообучают на десятках и сотнях тысяч примеров «запрос — хороший ответ», составленных людьми. После этого она понимает формат «вопрос — ответ», следует инструкциям, держит роль ассистента.
- Обучение с подкреплением на обратной связи от людей (RLHF) и его аналоги. Модель генерирует несколько вариантов ответа, люди ранжируют их от лучшего к худшему, на этих оценках обучают модель-оценщик (reward model), а затем основную модель методами обучения с подкреплением доводят до ответов, которые оценщик считает полезными, точными и безопасными. Как дрессировка: за удачный ответ — «награда». Похожим способом, но с автоматической проверкой результата (решена ли задача, прошёл ли код тесты), модели учат рассуждать по шагам — так появились «думающие» (reasoning) модели.
После обучения веса модели заморожены. Когда вы задаёте вопрос, модель ничего не доучивает «на лету» — это называется инференс (inference), и именно за него вы платите провайдеру.
Дообучение под компанию: когда оно нужно
Компании часто хотят «обучить нейросеть на наших документах». В большинстве случаев для этого не нужен fine-tuning: достаточно подать нужные документы модели в запросе (подход RAG, о нём ниже). Дообучение имеет смысл, когда нужно закрепить стиль, формат или узкую классификацию на тысячах однотипных примеров, либо заставить небольшую открытую модель работать не хуже крупной на одной конкретной задаче. Для этого используют лёгкие методы вроде LoRA (low-rank adaptation): исходные веса модели не меняются, а обучается небольшой «адаптер» — добавочные матрицы, в которых доли процента от числа параметров модели. Это требует в разы меньше видеопамяти и вычислений, чем полное дообучение.
Контекстное окно: «оперативная память» модели
Контекстное окно — это объём текста в токенах, который модель способна учесть за один запрос: инструкции, история диалога, приложенные документы и сам ответ. У флагманских моделей 2026 года окно доходит до миллиона токенов — это несколько толстых книг или кодовая база среднего проекта. У многих других облачных моделей, включая российские, окно от 32 до 128–256 тысяч токенов — от нескольких десятков до нескольких сотен страниц.
Три вещи, которые важно понимать про контекст:
- У модели нет памяти между запросами. Иллюзию памяти в чате создаёт интерфейс: он каждый раз заново отправляет всю историю переписки. Когда история перестаёт помещаться в окно, начало диалога «забывается».
- Большой контекст — это дорого. Каждый токен в окне оплачивается при каждом запросе. Загрузить в бота 300-страничный регламент «целиком на всякий случай» — значит платить за 300 страниц в каждом ответе.
- Больше — не значит точнее. На очень длинных документах модели хуже замечают детали из середины текста. Поэтому в рабочих системах модели подают не всё подряд, а только релевантные фрагменты.
Параметры и размер модели: что значат 8B и 70B
Параметры (веса) — это числа внутри нейросети, которые подбираются при обучении и хранят всё, что модель «выучила». Буква B в названии — billion, миллиард: Qwen 8B — модель на 8 млрд параметров, 70B — на 70 млрд.
Грубо: чем больше параметров, тем больше модель знает и тем лучше рассуждает, но тем дороже и медленнее её запуск. Модель на 7–14B после сжатия (квантизации до 4–8 бит) запускается на одной игровой или рабочей видеокарте с 16–24 ГБ памяти и хорошо справляется с узкими задачами: классификация обращений, извлечение полей из документов, короткие ответы по базе знаний. Плотной модели уровня 70B в 16-битной точности нужно около 140 ГБ только под веса — это 2–4 серверные GPU класса A100/H100 на 80 ГБ с учётом памяти под контекст. В 4-битной квантизации она помещается на одну такую карту, но с некоторой потерей качества.
У многих новых моделей архитектура MoE (mixture of experts, «смесь экспертов»): общее число параметров огромное, но на каждый токен работает лишь их часть. Например, у модели на сотни миллиардов параметров активны при генерации десятки миллиардов. Скорость у таких моделей ближе к небольшим, но хранить в памяти видеокарт всё равно нужно все веса.
Открытые и закрытые модели: какие LLM есть в 2026 году
Закрытые модели доступны только через сервис разработчика: вы отправляете запрос в API и получаете ответ, но веса модели не видите и на свой сервер поставить не можете. Открытые (open-weight) модели публикуются с весами: их можно скачать, запустить в своём контуре и дообучить — с оглядкой на лицензию.
| Модель | Разработчик | Тип | Где сильна |
|---|---|---|---|
| GPT | OpenAI (США) | Закрытая; gpt-oss — открытые веса (Apache 2.0) | Универсал: рассуждения, код, агенты |
| Claude | Anthropic (США) | Закрытая | Код, длинные документы, аккуратные ответы |
| Gemini | Google (США) | Закрытая; открытая линейка — Gemma | Мультимодальность, длинный контекст |
| YandexGPT / Алиса AI | Яндекс (РФ) | Закрытая; открыты компактные YandexGPT 5 Lite (своя лицензия) и Alice AI Search Pretrain (Apache 2.0) | Русский язык, облако в РФ, RAG в Yandex Cloud |
| GigaChat | Сбер (РФ) | В облаке — закрытая; линейки GigaChat 3 и 3.5 — открытые веса под MIT | Русский язык, облако в РФ, свой контур |
| DeepSeek | DeepSeek (Китай) | Открытые веса (MIT) | Код, логика, низкая цена API |
| Qwen | Alibaba (Китай) | Открытые веса (Apache 2.0); флагманы Max — закрытые | Широкая линейка размеров, мультиязычность |
| Llama | Meta (США; признана экстремистской и запрещена в РФ) | Открытые веса, собственная лицензия с ограничениями; новый флагман Muse Spark — закрытый | Большая экосистема инструментов, но развитие линейки замедлилось |
| Mistral | Mistral AI (Франция) | Часть моделей открыта (Apache 2.0), включая Mistral Large 3 | Компактные и быстрые модели |
Линейки обновляются каждые несколько месяцев, а лицензии меняются вместе с ними: в 2026 году Meta и Alibaba перевели свои флагманы в закрытый формат, а Сбер и DeepSeek, наоборот, выложили крупные модели с открытыми весами. Поэтому конкретную версию модели имеет смысл выбирать и фиксировать на момент пилота, а не по прошлогодней статье. С чего начать выбор под бизнес-задачу — в нашем материале о нейросетях для бизнеса.
Ограничения LLM: галлюцинации, устаревшие знания, стоимость, данные
- Галлюцинации. Модель выдаёт правдоподобный, но неверный ответ: несуществующую статью закона, выдуманную цифру, чужую цену. Это не баг конкретной модели, а следствие принципа работы — она продолжает текст вероятно, а не истинно. Лечится подачей проверенных данных в контекст (RAG), требованием ссылаться на источник и проверкой человеком там, где цена ошибки высока.
- Дата среза знаний. Модель знает мир на момент окончания обучения. О новых ценах, законах и ваших товарах она не знает, пока вы не передадите эту информацию в запрос или не подключите поиск.
- Стоимость. Цена токенов у разных моделей различается в десятки раз: в 2026 году миллион выходных токенов стоит от нескольких десятков рублей у недорогих моделей до нескольких тысяч рублей у флагманов, а у топовых «pro»-версий — ещё дороже. На большом потоке запросов выбор модели и длина контекста напрямую определяют бюджет.
- Данные. Всё, что вы отправляете в облачную модель, уходит на сервер провайдера. Для персональных данных и коммерческой тайны это юридический вопрос, а не только технический.
- Нестабильность. Один и тот же запрос может дать разные ответы, а смена версии модели у провайдера — изменить поведение готового решения. Рабочим системам нужны тесты и мониторинг качества.
- Слабая арифметика и точные вычисления. Считать, сверять суммы и сортировать данные надёжнее кодом, который модель вызывает как инструмент, чем «в уме» модели.
Как бизнес использует LLM: API, RAG, агенты
Веб-чат для сотрудников — самый простой уровень. Реальная отдача появляется, когда модель встроена в процессы. Типовых схем три.
Прямой вызов через API
Ваша система отправляет в модель текст с инструкцией и получает результат: разобрать входящее письмо по полям, классифицировать обращение, составить описание товара, выжать суть из звонка. Что такое API и как он связывает системы, мы разбирали в отдельной статье об API простыми словами.
RAG — ответы по вашей базе знаний
RAG (retrieval-augmented generation) — это когда перед ответом система находит в ваших документах релевантные фрагменты и передаёт их модели вместе с вопросом. Модель отвечает не «из головы», а по вашим регламентам, каталогу и договорам, со ссылкой на источник. Это основной способ снизить галлюцинации и сделать LLM полезной для поддержки, продаж и внутренних консультаций — на этом строятся, например, ИИ-боты для сайта.
Агенты — модель, которая выполняет действия
Агент — это LLM, которой дали инструменты: создать сделку в CRM, проверить остаток в 1С, отправить письмо, сверить документ. Модель сама решает, какие шаги сделать и в каком порядке. Чем агент отличается от обычного чат-бота и из чего он состоит, мы разобрали в статье «Что такое ИИ-агент простыми словами», а примеры задач — на странице разработки AI-агентов для бизнеса.
На практике путь почти всегда один: отбор задачи с измеримым эффектом, пилот на реальных данных, замер точности и экономии, затем интеграции и вывод в работу. Так устроено внедрение искусственного интеллекта без экспериментов «наобум».
Локальная LLM на своём сервере: когда она нужна
Локальная LLM — это открытая модель, запущенная на вашем сервере или в арендованном в РФ облаке, без отправки данных внешнему провайдеру. Для запуска используют инструменты вроде vLLM, Ollama или LM Studio, а сам сервер с GPU требует той же настройки и администрирования Linux-сервера, что и любая продакшн-система: мониторинг, резервные копии, обновления.
Поводы для локального запуска:
- Персональные данные и 152-ФЗ. Отправка персональных данных клиентов в зарубежный API — это трансграничная передача (ст. 12 152-ФЗ): нужно правовое основание и, с 1 марта 2023 года, отдельное уведомление Роскомнадзора, а в страны без «адекватной» защиты ПДн, включая США и Китай, передавать данные можно только после рассмотрения уведомления. При этом запись, накопление и хранение ПДн россиян должны вестись в базах на территории РФ (ч. 5 ст. 18), так что зарубежный API не может быть основным местом их хранения. Проще, когда данные вообще не покидают ваш контур или российское облако.
- Коммерческая тайна. Договоры, финансовая отчётность, исходный код, переписка с контрагентами — всё, что вы не готовы отдавать третьей стороне даже при гарантиях провайдера.
- Требования заказчиков и отрасли. Госсектор, финансы, медицина, промышленность часто прямо запрещают внешние облачные сервисы.
- Предсказуемость. Модель не поменяется без вашего решения, нет зависимости от блокировок, санкций и изменения тарифов.
| Вариант | Данные | Качество | Затраты |
|---|---|---|---|
| Зарубежный API (GPT, Claude, Gemini) | Уходят за рубеж | Максимальное | Только за токены |
| Российское облако (YandexGPT, GigaChat) | Остаются в РФ, у провайдера | Высокое на русском | Только за токены |
| Открытая модель на своём сервере | Не покидают контур | Зависит от размера модели и настройки | GPU-сервер 24/7 + обслуживание |
Обратная сторона локального запуска — деньги и компетенции. Сервер с видеокартами уровня A100/H100 стоит дорого и оплачивается круглосуточно независимо от нагрузки, его нужно администрировать, обновлять модели и следить за качеством. Поэтому частый компромисс — гибрид: чувствительные данные обрабатывает локальная модель или обезличиваются перед отправкой, а всё остальное идёт в облачный API.
Типичные ошибки при работе с LLM
- Использовать модель как справочник. Спрашивать у голой LLM цены, нормы закона и характеристики товаров без подачи источников — прямой путь к уверенным выдумкам.
- Выбирать модель по хайпу. Самая известная модель не всегда лучшая для задачи: для разбора заявок часто хватает недорогой, а флагман увеличивает счёт в десятки раз.
- Отправлять в публичный чат рабочие документы. Сотрудники копируют в бесплатные чат-боты договоры и базы клиентов — это утечка, о которой компания не знает. Нужны правила и корпоративный доступ.
- Не тестировать на реальных данных. Демо на трёх удачных примерах ничего не говорит о работе на тысяче живых обращений с опечатками и нестандартными формулировками.
- Не предусмотреть человека. В спорных и дорогих случаях (возвраты, претензии, медицина, юридические вопросы) последнее слово должно оставаться за сотрудником.
Чек-лист: что проверить перед тем, как внедрять LLM
- Сформулирована конкретная задача и метрика: сколько времени, денег или ошибок должна сэкономить модель.
- Понятно, какие данные нужны модели и где они лежат (CRM, 1С, база знаний, почта).
- Определено, есть ли среди данных персональные данные и коммерческая тайна, и выбран контур: зарубежный API, российское облако или свой сервер.
- Для ответов по фактам предусмотрен RAG со ссылкой на источник, а не «знания модели».
- Несколько моделей сравнены на 50–100 реальных примерах, посчитана стоимость на месячный объём запросов.
- Проверена лицензия, если модель открытая и решение будет коммерческим.
- Есть сценарий передачи сложных случаев человеку и мониторинг качества после запуска.
- Зафиксирована версия модели, а её смена проходит через повторное тестирование.
LLM — это языковой движок, который предсказывает текст токен за токеном и за счёт трансформера хорошо улавливает смысл. Он не знает ваших данных, ошибается уверенно и стоит денег за каждый токен, но в связке с вашей базой знаний, интеграциями и контролем человека берёт на себя заметную часть рутины: ответы клиентам, разбор документов, заявки, отчёты. Выбор между облачной, российской и локальной моделью определяется не модой, а данными, требованиями закона и экономикой конкретной задачи.
