没有每日上限。没有 token 限额。场景中途没有付费墙。
托管 AI 聊天里最糟的时刻,是对话正顺畅时,一条横幅告诉你等到明天或去升级。这个限制并非任意,你发的每条消息都要花服务方真金白银的 GPU 时间。privstory 没有它,因为那点 GPU 时间是你的。
为什么托管聊天要对你计数
运行一个语言模型是按消息花钱的。托管服务为每个用户承担这笔成本,因此必须以某种方式给使用量设界:每日消息数、token 预算、点数余额、给免费用户的较慢模型,或者一个抬高上限的订阅档位。
这套机制是模型住在他们硬件上的直接结果。再多的善意也无法移除它,因为你这次对话的边际成本是真实的,总得有人来承担。
当模型是本地的,会有什么改变
聊天模型运行在你机器上的一个进程里,用你的 GPU 或 CPU 和你的电。对其他任何人而言,一条消息的边际成本为零,所以没有什么可计费,也没有理由打断你。
没有要盯着的计数器,没有冷却时间,没有“对你的档位来说太长”的对话概念,你当天第一条消息和第一千条消息之间也没有质量差别。场景想持续多久就多久。
唯一真正的限制:你自己的硬件
老实说取舍:本地生成受你运行它的机器所限。在较新的 Apple Silicon Mac 或独立 GPU 上,回复以舒适的阅读速度到来。在集成显卡上会更慢,而在 CPU 回退模式下,尤其是图像生成会很慢。
这是速度限制,不是用量限制,它不会在午夜重置,也不会开口要钱。想要更快,答案是更小的模型或更好的硬件,两者都由你决定。
免费版有何不同
免费版限制的是你能拥有多少个角色和场景,各一个,而不是你在其中能说多少。无论免费版还是许可版,消息量都不受限。
一次性许可证会解除角色和场景的限制。它不会增加消息容量,因为从来就没有需要解除的消息限制。
常见问题。
免费版里消息真的不限量吗?
是的。免费版把你限制在一个角色和一个场景,但在那个场景里你想发多少消息都行。没有每日上限、token 预算,也没有限速。
对话变长后会变差或被截短吗?
非常长的场景最终会超出模型一次能容纳的上下文,这是你模块里那个模型的特性,而不是计费限制。不同模块提供不同的模型,所以实际上限取决于你选哪一个。
到底有没有按消息计的费用?
对我们来说没有。唯一的开销是你自己机器生成回复所花的电和时间。什么都不计费、不计数、不上报。