загрузка по требованию
just-in-time loading
Режим, в котором раннер грузит модель только когда приходит запрос и выгружает обратно после таймаута простоя, вместо того чтобы весь день держать веса в памяти. Вы меняете несколько секунд загрузки на запрос на гигабайты, возвращённые в промежутках. LM Studio делает это отдельно для каждой модели, и таймаут вынесен в настройки.
Сама загрузка — это memory-mapped чтение с SSD, поэтому стоит она примерно как размер файла, делённый на скорость чтения диска. Модель в 20 ГБ на накопителе, выдающем 3 ГБ в секунду, — это около семи секунд до того, как начнутся хоть какие-то вычисления.
Стоит ли оно того, зависит целиком от ритма. Если запросы приходят чаще таймаута, модель никогда не выгружается и настройка не стоила вам ничего. Если вы спрашиваете её что-то дважды в день, держать припаркованными 20 ГБ — это память на сутки ради экономии четырнадцати секунд.
Ломается всё, когда моделей держат несколько. Каждая загруженная по требованию остаётся в памяти, пока не дотикает её собственный таймер, и машина запросто оказывается с тремя наборами весов, которых у неё никто не просил.