The Benchmarks
Посмотреть, на что локальная модель реально способна.
Прогон модели на настоящих задачах: где она держится и подходит ли под то, что нужно именно вам. Прогоны сравнимы между собой, поэтому результатами можно делиться и сверяться с чужими.

| Стек | Rust · Tauri · JavaScript · LLM |
|---|---|
| Роль | Разработчик |
| Год | 2026 — настоящее время |
| Платформа | macos · windows |
| Статус | В разработке |
Обзор
The Benchmarks — это «3DMark для LLM»: десктопное кроссплатформенное приложение, которое тестирует локальные языковые модели и, что важнее, одну модель против самой себя — в разных квантованиях, рантаймах, режимах кэша и сэмплинга. Оно само находит и подключает LM Studio, Ollama и API-провайдеров вроде OpenRouter, прогоняет набор реальных задач в изолированной песочнице и показывает результат как отпечаток из граней — модель, квант, рантайм, железо — чтобы цифры действительно можно было сравнивать. Собрано в одиночку: движок бенчмарков на Rust, десктопная оболочка на Tauri и тёмный интерфейс «Studio».
Зачем это нужно
Облачные лидерборды ранжируют одну размещённую версию модели, а локально люди запускают квантованные модели на своём железе, где квант, рантайм и сэмплинг меняют ответ. The Benchmarks измеряет именно это — одну модель против самой себя в разных конфигурациях, — чтобы было видно, что вы на самом деле теряете (или сохраняете), спускаясь с полной точности до 4-битного кванта.
Ответы модели занимают мало места, и хранилище дешёвое; настоящая проблема — сравнимость. Каждый результат привязан к отпечатку: хеш содержимого модели, квант, версия рантайма, длина контекста, сэмплинг и класс железа. Так цифра в ток/с никогда не остаётся голой.
Архитектура
В ядре на Rust живёт движок бенчмарков: наборы задач описаны в TOML, отдельный шов для конфигурации генерации даёт настоящий детерминизм, режимы сэмплинга пишут сид в результат, а слой оценки считает баллы по правилам проверки и весам сложности.
Бенчмарки на починку кода выполняют правку модели во встроенной JS-песочнице против скрытых тестов — умение писать код оценивается запуском, а не похожестью текста.
Оболочка на Tauri оборачивает движок в нативное десктопное приложение с тёмным интерфейсом «Studio»: рейка с иконками, пошаговый сценарий «Модели → Объём → Запуск», подбор параметров по сетке и локальная история — всё поверх тех же команд Rust.
Ключевые возможности
Сравнение модели с самой собой по квантованиям, рантаймам, кэшу и сэмплингу — то, чего облачные лидерборды не умеют.
Автоматически находит и подключает LM Studio, Ollama и OpenRouter одной реализацией OpenAI-совместимого провайдера.
Бенчмарки на починку кода без доступа в сеть: песочница на JS выполняет правку модели против скрытых тестов и оценивает её объективно.
Жёсткие детерминированные проверки (диапазон, вхождение, регулярка), взвешивание по сложности и профиль возможностей для каждой модели.
Отпечаток результата из граней (модель · квант · рантайм · железо), чтобы краудсорсные ток/с и качество оставались сравнимыми.
Тёмный десктопный интерфейс «Studio»: пошаговый запуск, подбор параметров по сетке и локальная история прогонов.
Дальше
Заинтересовал проект?
Посмотрите живую версию или напишите мне о чём-то похожем.