Ускорение на GPU, на той GPU, что у тебя уже есть.

Запуск моделей локально обычно означает проект по настройке: тулкит CUDA, окружение Python, версия драйвера, которая должна совпасть. privstory, нативное приложение с ускорением, встроенным в загрузку. Установи его, и оно использует то, что есть у твоей машины.

Один установщик на платформу, никакого тулкита

На macOS Apple Silicon использует бэкенд Metal автоматически. Нечего выбирать и нечего устанавливать рядом.

В Windows и Linux сборки используют Vulkan, который охватывает GPU NVIDIA, AMD, Intel и встроенные с одного установщика. Нет отдельной сборки CUDA для выбора и нет тулкита драйверов для настройки. Если пригодной GPU не найдено, приложение переходит на CPU, а не отказывается запускаться.

Сколько памяти тебе на самом деле нужно

Единого числа нет, потому что privstory не поставляет модели. Модуль приносит собственную модель чата и модель изображений, так что потребность, это то, что нужно моделям этого модуля. Небольшой модуль удобно работает на скромном железе; крупный хочет много VRAM.

Полезная деталь в том, что две модели никогда не находятся в памяти одновременно. Пиковая память задаётся большей из модели чата и модели изображений, а не их суммой, именно это делает модуль с двумя солидными моделями пригодным на одной GPU среднего класса.

Каково это по ощущению производительности

Генерация текста, более лёгкая половина. На недавнем Mac с Apple Silicon или дискретной GPU ответы приходят примерно в темпе чтения, это тот момент, когда разговор ощущается живым, а не пакетно обработанным.

Генерация изображений, более тяжёлая половина и более ясная проверка твоего железа. На способной GPU портрет или фон приходит за секунды. На встроенной графике заметно дольше, а в режиме CPU медленно, годится, чтобы попробовать приложение, но не то же, что на GPU.

Ничего не выгружается нам

Нет гибридного режима, где тяжёлая работа тихо уходит на сервер. Каждый токен и каждый пиксель вычисляется на твоей машине, именно это вообще делает возможными приватность и отсутствие лимитов использования.

Следствие стоит сказать прямо: твоё железо, это потолок производительности. Это обмен, на который ты идёшь ради чата без биллинга, без аккаунта и без данных, покидающих устройство.

Частые вопросы.

Нужна ли мне GPU NVIDIA в Windows или Linux?

Нет. Каждая загрузка ускорена на GPU из коробки. macOS использует Metal; сборки Windows и Linux используют Vulkan, так что GPU NVIDIA, AMD, Intel и встроенные поддерживаются одним установщиком, без отдельной сборки или тулкита драйверов. Приложение переходит на CPU, если не находит пригодной GPU.

Сколько VRAM мне нужно?

Зависит от модуля, поскольку модуль поставляет обе модели. Так как модель чата и модель изображений никогда не находятся в памяти одновременно, тебе нужно достаточно для большей из двух, а не для обеих вместе.

Запустится ли оно вообще без GPU?

Да, в режиме CPU. Генерация текста терпима; генерация изображений медленная. Это способ попробовать приложение, а не тот опыт, для которого оно сделано.

Работает ли что-либо на сервере ради производительности?

Нет. Нет никакой выгрузки любого рода. Единственный сетевой доступ, разовая загрузка модели и, если ты вводишь лицензионный ключ, лёгкая проверка лицензии.