GPU 加速,用你已经有的那块 GPU。

在本地运行模型通常意味着一个配置工程:一个 CUDA 工具链,一个 Python 环境,一个必须匹配的驱动版本。privstory 是一个把加速内置进下载里的原生应用。装上它,它就会使用你机器所拥有的东西。

每个平台一个安装程序,无需工具链

在 macOS 上,Apple Silicon 自动使用 Metal 后端。没有东西要选择,也没有东西要另外安装。

在 Windows 和 Linux 上,构建版使用 Vulkan,从同一个安装程序覆盖 NVIDIA、AMD、Intel 和集成 GPU。没有单独的 CUDA 版本要选,也没有驱动工具链要配置。如果找不到可用的 GPU,应用会回退到 CPU,而不是拒绝启动。

你实际需要多少内存

没有单一的数字,因为 privstory 不附带模型。一个模块自带聊天模型和图像模型,所以需求就是那个模块的模型所需要的。小模块在普通硬件上运行自如;大模块则需要很多 VRAM。

有用的一点是,这两个模型从不同时驻留内存。峰值内存由聊天模型和图像模型中较大的那个决定,而不是它们之和,正是这一点让一个带两个大模型的模块,在一块中端 GPU 上也可行。

性能大概是什么感觉

文字生成是较轻的那一半。在较新的 Apple Silicon Mac 或独立 GPU 上,回复大致以阅读速度到来,正是从这个点起,对话让人感觉是实时的,而不是批量处理的。

图像生成是较重的那一半,也是对你硬件更明确的考验。在一块有能力的 GPU 上,一张头像或背景几秒钟就到。在集成显卡上会明显更久,而在 CPU 回退下会很慢,可以用来试用应用,但不是它在 GPU 上的样子。

没有任何东西被卸载给我们

没有那种把繁重工作悄悄送去服务器的混合模式。每个 token 和每个像素都在你的机器上计算,正是这一点才使得隐私和没有用量限制成为可能。

有一个后果值得明说:你的硬件就是性能上限。这是你为一个没有计费、没有账号、也没有数据离开设备的聊天所做的交换。

常见问题。

在 Windows 或 Linux 上我需要 NVIDIA GPU 吗?

不需要。每个下载都开箱即用地由 GPU 加速。macOS 使用 Metal;Windows 和 Linux 构建版使用 Vulkan,所以 NVIDIA、AMD、Intel 和集成 GPU 都由同一个安装程序支持,无需单独的构建版或驱动工具链。如果找不到可用的 GPU,应用会回退到 CPU。

我需要多少 VRAM?

取决于模块,因为模块提供两个模型。由于聊天模型和图像模型从不同时驻留内存,你只需要足够运行两者中较大的那个,而不是两者相加。

完全没有 GPU 也能运行吗?

能,用 CPU 回退。文字生成尚可接受;图像生成很慢。它是一种试用应用的方式,而不是它被设计出来所要带来的体验。

有没有东西出于性能原因运行在服务器上?

没有。没有任何形式的卸载。唯一的网络访问是一次性的模型下载,以及,如果你输入许可证密钥,一次轻量的许可证校验。