Глоссарий
Жаргон, который мешает разобраться в локальном ИИ, объяснённый по-человечески. Каждая статья ведёт туда, где слово реально встречается, — прочитать идею и сразу увидеть её в деле.
56 терминов · 0 встречаются в текстах
- агентagentМодель, крутящаяся в цикле с инструментами. Она получает цель, а не вопрос, просит что-нибудь выполнить (прочитать файл, запустить команду, поискать), получает результат назад и решает, что делать дальше. Агентом её делает цикл; сама модель по-прежнему только предсказывает следующий токен.
- активные параметрыactive parametersСколько модели реально работает, чтобы выдать один токен, в отличие от того, сколько её лежит в памяти. В имени вроде qwen3.6-35b-a3b число a3b — это оно: 35 миллиардов параметров хранится, 3 миллиарда используется на токен. Оно предсказывает скорость, а общее число — память.
- бит на весbits per weightСреднее число бит, которое каждый параметр реально занимает в файле, с учётом блочных множителей и повышенных слоёв. Именно оно задаёт размер загрузки, и оно никогда не совпадает с числом в названии: файл Q4_K_M в среднем даёт 4,83 бита, а не 4, поэтому модель на 27B выходит в 16,3 ГБ, а не в 13,5.
- вызов инструментовtool callingМодель пишет запрос на команду вместо ответа. Харнесс кладёт в промпт список доступных инструментов, модель отвечает текстом в форме вызова («запусти bash с ls src»), а харнесс выполняет его и вклеивает вывод обратно как контекст. Сама модель не выполняет ничего.
- граничное устройствоedge deviceЖелезо, которое запускает модель локально, на краю сети, а не звонит в дата-центр: телефон, ноутбук, маленький сервер в шкафу. Смысл в том, что инференс происходит на самом устройстве, поэтому данные никуда не уходят. 1-битная сборка модели на 27B, 3,9 ГБ на диске, работает на iPhone 17 Pro Max примерно на 11 токенах в секунду.
- декодированиеdecodeФаза письма. После префилла модель выдаёт по одному токену за проход, каждый дописывается к промпту и подаётся обратно на вход. Именно эту фазу меряют токены в секунду, и она упирается в пропускную способность памяти: каждый активный вес приходится вычитывать из памяти ради каждого отдельного токена.
- динамический диапазонdynamic rangeРасстояние между самым большим и самым маленьким значением, которое формат способен удержать. У фотографии это число ступеней между самым ярким светом и самой тёмной тенью, в которых ещё остаются детали. У числового формата это задаётся битами экспоненты — ровно поэтому BF16 и существует.
- дистилляцияdistillationОбучение маленькой модели, где большая работает учителем. Либо учитель — это файл, которым вы владеете, и тогда можно скопировать то, что он думает о каждом ответе, которого он не дал; либо это API, и тогда вам достаётся только вернувшийся текст. Почти любая модель, достаточно маленькая, чтобы работать на вашей машине, — это одно или другое.
- дообучениеfine-tuneПродолжение обучения выпущенной модели на своём небольшом наборе данных, чтобы она специализировалась. Стоит доли процента от исходного обучения — поэтому один релиз с открытыми весами превращается в сотни вариантов под код, документы, ролевые игры или тон одной конкретной компании.
- единая памятьunified memoryОдин пул оперативной памяти, общий для CPU и GPU, как на Apple Silicon, вместо раздельных системной памяти и выделенной видеопамяти. Благодаря этому Mac со 128 ГБ может отдать модели почти всё, без копирования между чипами. macOS ограничивает долю, доступную GPU, примерно 65–75% от общего объёма.
- загрузка по требованиюjust-in-time loadingРежим, в котором раннер грузит модель только когда приходит запрос и выгружает обратно после таймаута простоя, вместо того чтобы весь день держать веса в памяти. Вы меняете несколько секунд загрузки на запрос на гигабайты, возвращённые в промежутках. LM Studio делает это отдельно для каждой модели, и таймаут вынесен в настройки.
- инференсinferenceЗапуск обученной модели ради вывода, в отличие от её обучения. Когда вы пишете промпт и модель порождает ответ — это инференс. Он делится на две фазы: чтение вашего промпта (префилл) и написание ответа по одному токену (декодирование).
- квантованиеquantizationХранение каждого веса в меньшем числе бит ради уменьшения модели. Полная точность — 16 бит на вес; 4-битное квантование использует 4, урезая файл примерно до четверти. Модель на 27B падает с 54 ГБ на 16 битах до примерно 16 ГБ на 4 битах, с небольшой и обычно приемлемой потерей качества.
- конвейерный параллелизмpipeline parallelismРазрезание модели по слоям между машинами: первая машина держит слои с 1-го по 20-й, следующая — с 21-го по 40-й, и токен идёт по цепочке. Это то, что позволяет негабаритной модели влезть, и это не ускоряет ничего, потому что в каждый момент считает только одна машина.
- контекстное окноcontext windowМаксимум токенов, который модель держит одновременно: системный промпт, разговор, прочитанные файлы и всё, что она уже сказала. Фронтирные модели в 2026 году заявляют от 200 тысяч до 1 миллиона токенов. Когда окно заполняется, что-то приходится выбросить или пересказать, и о выброшенном модель не помнит ничего.
- мантиссаmantissaЧасть числа с плавающей точкой, в которой лежат значащие цифры, отдельно от экспоненты, задающей масштаб. При квантовании точность теряется именно на урезании битов мантиссы: грубая величина каждого веса сохраняется, а мелкие детали округляются. Это разница между «3,14159» и просто «3,1».
- матрица важностиimportance matrixЗамер того, на какие веса модель реально опирается: через неё прогоняют корпус настоящего текста и записывают, насколько каждый вес двигает вывод. Квантователи используют это, чтобы решить, что можно смять, а что надо защитить. Рецепты IQ в llama.cpp названы в её честь.
- мультимодальностьmultimodalМодель, принимающая на вход не только текст. На практике это означает изображения: скриншоты, фотографии, сканы PDF, закодированные в тот же поток токенов, что и промпт. Некоторые умеют ещё и звук. На выходе обычно всё равно текст.
- обрезкаpruningУдаление кусков обученной модели с сохранением остального, без переобучения. На модели mixture of experts это означает выбрасывание целых экспертов: метод REAP от Cerebras урезал Kimi K3 с 896 экспертов до 179, уменьшив файл с 1,56 ТБ до 350 ГБ за двое суток. Дёшево, быстро, и стоит вам способностей, которых уже ничем не вернуть.
- открытые весаopen weightsМодель, чьи обученные параметры опубликованы файлами, которые можно скачать и запустить. Это не то же самое, что открытый исходный код: обучающие данные и код, породивший веса, обычно придерживают. Llama, Qwen, Gemma, DeepSeek и gpt-oss — открытые веса. Fable и GPT — нет.
- параметрыparametersЧисла внутри модели, выученные при обучении и замороженные после. У модели на 27B их 27 миллиардов. Число параметров задаёт размер файла напрямую: по 2 байта каждый — это 54 ГБ на 27 миллиардов, а на 4 битах ближе к 16 ГБ. Это первое число почти в любом имени модели.
- плотная модельdenseМодель, где на каждый токен работает каждый параметр, без всякой маршрутизации. Плотная модель на 27B делает 27 миллиардов параметров работы на каждый порождённый токен. Проще, чем MoE, но при том же общем размере медленнее, потому что пропустить большую часть весов негде.
- префиллprefillФаза чтения. Прежде чем что-то написать, модель прогоняет через себя весь ваш промпт, каждый его токен, заполняя KV-кеш. Отсюда и берётся ожидание перед первым словом, и упирается оно в вычисления: плотная модель на 27B делает 27 миллиардов параметров арифметики на каждый присланный вами токен, A3B — 3 миллиарда.
- пропускная способность памятиmemory bandwidthНасколько быстро чип читает из оперативной памяти, в гигабайтах в секунду. Генерация текста читает каждый активный вес ради каждого отдельного токена, поэтому скорость генерации задаёт именно она, а не голые вычисления. M4 Max двигает около 546 ГБ/с; системная память настольного ПК — ближе к 80 ГБ/с.
- распределённый инференсdistributed inferenceЗапуск одной модели на нескольких машинах, потому что ни на одну из них она не влезает. Память складывается, и модель загружается. Скорость обычно не складывается: exo сообщает о 1,8× на двух устройствах и 3,2× на четырёх, когда ему удаётся расшардить слои, и ни о чём вообще, когда он может только сцепить их в цепочку.
- рассуждающая модельreasoning modelМодель, обученная выписывать свои выкладки прежде, чем ответить. Проход размышления — такой же порождённый текст, как любой другой, поэтому он стоит времени и токенов, и большинство интерфейсов его прячет. На замеренном прогоне на M4 Max модель 35B A3B дошла до первого токена за 2,66 секунды, а потом думала ещё 27.
- роутерrouterМаленькая сеть внутри mixture of experts, решающая для каждого токена, какие несколько экспертов запустить. Именно она заставляет модель на 35B делать работу модели на 3B: 35 миллиардов параметров лежат в памяти, а роутер каждый раз выбирает примерно 3 миллиарда из них. Kimi K3 маршрутизирует к 16 экспертам из 896.
- системный промптsystem promptБлок инструкций, который харнесс ставит перед вашим разговором, до того как модель что-либо увидит: кто она, что ей можно, какие есть инструменты и как их просить. Вы его не пишете, и он тратит контекстное окно наравне со всем остальным.
- смешанная точностьmixed precisionКвантование разных частей модели в разную битность вместо того, чтобы сминать всё одинаково. Типичный рецепт держит примерно 15% несущих весов на 8 битах, а остальные 85% опускает до 4 — это стоит чуть дороже равномерных 4 бит и сохраняет большую часть того, что равномерные 4 бита выбрасывают.
- спекулятивное декодированиеspeculative decodingПриём ускорения, не стоящий качества. Маленькая черновая модель угадывает несколько следующих токенов, большая проверяет их все за один проход и оставляет те, с которыми согласна. Вывод получается идентичным запуску одной большой модели, а ускорение обычно 1,5–2× и определяется целиком тем, как часто маленькая угадывает.
- тензорный параллелизмtensor parallelismРазрезание каждого отдельного слоя между машинами, так что над каждым токеном работает каждая машина и их пропускные способности памяти складываются. Это тот способ разрезания, который делает кластер быстрее, а не только больше. exo сообщает о 1,8× на двух устройствах и 3,2× на четырёх — почти линейно, но не совсем.
- токенtokenЕдиница, которую модель читает и пишет. Не слово и не символ, а обрывок чего-то из них, порождённый таблицей соответствий, построенной при обучении. У английского в среднем около четырёх символов на токен, так что 1000 слов — это примерно 1300 токенов. Всё измеряется, оценивается и ограничивается в токенах: контекстные окна, счета за API, скорость генерации.
- токенов в секундуtokens per secondНасколько быстро модель пишет, и то самое число, с которого начинается любой бенчмарк. Прикинуть его можно как пропускную способность памяти, делённую на байты активных параметров: 3 миллиарда активных на 8 битах — это 3 ГБ на токен, так что M4 Max с 546 ГБ/с упирается где-то в 180. Реальные замеры выходят вполовину или на три четверти от этого.
- харнессharnessПрограмма, обёрнутая вокруг модели и превращающая голое предсказание текста во что-то полезное: она управляет промптом, запускает инструменты, которые модель просит, возвращает результаты и крутит цикл. Модель только предсказывает токены; агентом её делает харнесс. Claude Code и подобные инструменты — это харнессы.
- экспонентаexponentЧасть числа с плавающей точкой, задающая его масштаб, отдельно от мантиссы, в которой лежат цифры. Больше бит экспоненты — шире диапазон порядков, прежде чем число переполнится в бесконечность или схлопнется в ноль. BF16 тратит сюда 8 из своих 16 бит; FP16 тратит 5 — поэтому обучение в FP16 переполняется, а в BF16 нет.
- BF16Brain floating point — 16-битный числовой формат, придуманный Google Brain для машинного обучения. Он сохраняет ту же 8-битную экспоненту, что и полный 32-битный float, поэтому достаёт до тех же порядков величин, и расплачивается за это мантиссой, урезанной до 7 бит. Большинство открытых весов выходит в BF16 по 2 байта на параметр — поэтому модель на 27B и весит 54 ГБ.
- chat completionСамый простой способ использовать модель: вы отправляете список сообщений, она отправляет один ответ, и больше ничего не происходит. Ни инструментов, ни файлов, ни второго хода по её собственному решению. Это один HTTP-запрос куда-нибудь на http://127.0.0.1:1234/v1/chat/completions, и любой агент или харнесс, который вам встретится, — это программа, делающая этот же вызов в цикле.
- FP16Старший 16-битный float: 1 бит знака, 5 бит экспоненты, 10 бит мантиссы. Он держит более тонкие детали, чем BF16, но достаёт до заметно более узкого диапазона порядков, из-за чего обучение в нём переполняется. Оба формата — по 2 байта на параметр, так что файлы выходят одинакового размера.
- GGUFОднофайловый формат моделей, который использует llama.cpp и всё, что на нём построено, — Ollama, LM Studio. Один файл .gguf держит веса, квантование и метаданные, так что вы просто скачиваете и запускаете. Названия рецептов вроде Q4_K_M описывают, как внутри него квантовались слои.
- GQAgrouped-query attentionСхема внимания, в которой один ключ и одно значение делятся между несколькими головами запросов, вместо того чтобы каждой голове давать свою пару. Она сжимает KV-кеш в четыре-восемь раз почти без потери качества — поэтому модели класса 27B на 32 тысячах токенов хватает 1–4 ГБ кеша, а не 10.
- K-quantСемейство рецептов смешанной точности из llama.cpp — те, у которых в названии есть K. Веса хранятся блоками с общим масштабным множителем, а фиксированное правило поднимает отдельные семейства слоёв выше номинальной битности. Хвостовая S, M или L говорит, насколько много рецепт повышает.
- KV-кешKV cacheКратковременная память модели на текущий разговор. Читая ваш промпт, она сохраняет вектор ключа и значения для каждого токена, чтобы не перечитывать их заново ради каждого нового слова. Кеш растёт вместе с длиной контекста: примерно 1–4 ГБ для модели класса 27B на 32 тысячах токенов, и живёт он в оперативке рядом с весами.
- llama.cppДвижок инференса на C++, на котором построено большинство инструментов для локального ИИ, включая Ollama и LM Studio. Он работает на CPU, CUDA, Metal и Vulkan — поэтому файлы GGUF, которые он читает, работают почти на любой машине. Рецепты квантования с именами вроде Q4_K_M и IQ3_XXS — его.
- LM StudioНастольное приложение для запуска моделей локально: поискать в каталоге, скачать сборку GGUF или MLX, поговорить с ней и включить сервер, который говорит на OpenAI-совместимом API по адресу http://127.0.0.1:1234. Это вариант всего этого без терминала внутри — поэтому большинство и начинает отсюда.
- localhostАдрес, по которому машина разговаривает сама с собой. `127.0.0.1`, и `localhost` — это имя для него. Локальный раннер моделей слушает там, поэтому `http://127.0.0.1:1234` попадает в LM Studio на той машине, где вы это набрали, и никуда больше. Ничто отправленное туда не покидает компьютер и не касается сети.
- MCP-серверMCP serverНебольшая программа, отдающая модели инструменты или данные через Model Context Protocol — общий стандарт того, как харнессы подключаются к инструментам. Вместо того чтобы зашивать интеграцию, вы направляете харнесс на MCP-сервер, и модель может вызывать всё, что тот предлагает: файлы, базу, API. Один протокол, много подключаемых инструментов.
- MLXФреймворк Apple для работы с массивами, запускающий модели на Apple Silicon и заточенный под прямое использование GPU и единой памяти. Сборки MLX часто работают на Mac быстрее эквивалентного GGUF и выходят в собственном формате. Это нативная для Apple альтернатива стеку llama.cpp.
- MoEMixture of Experts, смесь экспертов. Модель разбита на множество маленьких подсетей (экспертов), и роутер выбирает для каждого токена лишь несколько из них. Модель на 35B с 3B активных на токен держит в памяти все 35B, но считает как модель на 3B, поэтому отвечает намного быстрее плотной модели того же общего размера.
- multi-token predictionСпекулятивное декодирование со встроенной черновой моделью. Модель обучена с дополнительной головой, предсказывающей токен через один, поэтому она сама предлагает продолжения и сама же проверяет их за один проход — без второй модели, которую надо грузить и держать в памяти. Популяризовал приём DeepSeek V3.
- MXFP44-битный формат с плавающей точкой, в котором один масштабный множитель делится на небольшой блок весов, — так сохраняется больше динамического диапазона, чем у простых 4-битных целых. В нём выходят GPT-OSS-120B и Kimi K3. Раскладка с плавающей точкой означает, что 16 доступных значений расставлены полезнее, чем равномерно отстоящие целые.
- OllamaЛокальный раннер моделей, построенный на llama.cpp и управляемый из терминала. `ollama run gemma4` скачивает веса и запускает чат. Он ещё и отдаёт OpenAI-совместимый API на порту 11434 — благодаря чему другие программы на вашей машине говорят с моделью, ничего не зная о том, как она загружена.
- OpenAI-совместимый APIOpenAI-compatible APIДе-факто стандартная форма разговора с моделью по HTTP: шлёте POST со списком сообщений на /v1/chat/completions, получаете ответ. Форму задала OpenAI, и каждый локальный раннер её копирует, поэтому LM Studio и Ollama оба отвечают на http://127.0.0.1:1234 или :11434 в одном и том же формате запроса.
- Q4_K_MСамый скачиваемый 4-битный рецепт llama.cpp и безопасный вариант по умолчанию. Q4 — четыре бита на вес, K — схема K-quant с поблочными множителями, M — средний размер внутри неё, где слои внимания и feed-forward, которые важнее прочих, поднимаются выше четырёх бит. Модель на 27B выходит около 16 ГБ.
- safetensorsПростой формат файлов весов, в котором выпускает большинство лабораторий, и то, чем на деле является сборка MLX под этим именем. Он хранит тензоры и небольшой заголовок и ничего исполняемого — в этом и безопасная часть: старый формат на pickle мог выполнить код при загрузке.
- TTFTTime To First Token, время до первого токена: сколько вы ждёте после нажатия Enter, прежде чем модель выдаст хоть что-нибудь. В основном это префилл, чтение моделью всего вашего промпта, — поэтому длинный промпт или документ делает ожидание хуже. На плотной модели в 27B большой промпт может означать минуту-две ожидания, прежде чем что-то появится.
- VRAMПамять, распаянная на видеокарте, отдельно от системной оперативки компьютера. На ПК это жёсткий потолок для локальных моделей: потребительские карты NVIDIA идут с 8–24 ГБ, а верхняя граница доходит до 32 ГБ. Модель, которая не влезла, выплёскивается в системную память и замедляется на порядок.