中文 ▾
获取 API 密钥

无审查 LLM:选项比较

无审查 LLM 是移除了对齐层的基础模型,使其能够回答争议性、NSFW 或小众问题,而不会出现标准商业模型常见的拒绝行为。本指南比较了在本地运行这些模型与使用托管 API 之间的技术权衡,帮助你为开发需求选择最佳的部署策略。

更新于

要点

  • 去对齐模型移除了基础模型(如 Llama 3 或 Mistral)中导致拒绝的“礼貌”过滤机制。
  • 本地部署提供完全隐私,但需要大量的 GPU 硬件和维护开销。
  • 托管 API 提供即时访问和简单的预付费 token 计费,消除了基础设施的复杂性。
  • 本地与托管之间的选择取决于你在数据隐私、硬件成本和集成便利性之间的平衡。

什么是无审查 LLM?

大型语言模型 (LLM) 通常经过称为“基于人类反馈的强化学习” (RLHF) 的过程,以使其符合人类偏好。这种对齐使它们变得礼貌、简洁和安全,但也引入了拒绝行为。当你询问对齐模型关于争议性话题或请求 NSFW 内容时,它可能会拒绝,即使内容完全合法,也会引用安全指南。

去对齐 LLM 是指移除了这些对齐层或经过“去对齐”处理的模型。这是通过对模型权重减去对齐向量来实现的。结果是一个保留核心智能和推理能力但缺乏特定“拒绝”机制的模型。它将直接回答您的问题,无论主题是否敏感、涉及性还是政治敏感,且没有典型的回避或说教。

  • 无拒绝: 模型基于其训练数据回答,而非安全过滤器。
  • 原始输出: 响应通常更直接,且较少针对人类阅读进行格式化。
  • 基础完整性: 底层知识和逻辑保持完整,仅移除了“个性”过滤器。

此过程与微调不同。微调教会模型新技能,而 abliteration 仅移除约束。这使得无审查模型成为希望进行原始数据提取或创意自由且不受内容过滤干扰的开发者的理想选择。

本地与托管部署

一旦你拥有无审查模型,你需要一种运行方式。主要有两条路径:本地部署或使用托管 API。每条路径都有独特的技术和经济影响。

本地部署: 在自己的硬件上运行模型可让您拥有绝对控制权。您的数据永远不会离开您的机器,这对于隐私敏感的应用至关重要。然而,您需要承担硬件成本、电费、冷却和更新费用。您需要大量的 VRAM;在本地运行 70B 参数模型可能需要多张高端 GPU。

托管 API: 托管服务在远程服务器上运行模型。您通过 HTTP 发送请求并接收响应。这消除了硬件管理需求,并允许您即时扩展。您仅按实际使用量付费,通常通过预付 token 支付。代价是您的数据会经过第三方服务器,尽管许多提供商不会使用您的提示词进行训练。

功能本地托管 API
数据隐私高中
前期成本高(硬件)低
可扩展性由硬件固定高
维护自我管理提供商管理

对于大多数开发者来说,托管 API 提供了成本与便利的最佳平衡,尤其是在起步阶段。

Ollama 和本地模型

Ollama 已成为在本地运行开源 LLM 的标准工具。它简化了下载、量化和提供 Llama 3、Mistral 或 Qwen 等模型的过程。您可以轻松下载这些模型的去对齐版本,并通过本地 API 接口提供服务。

使用 Ollama,您可以使用简单的命令如 ollama pull abliterated-model 拉取模型。该工具处理量化过程,允许您在消费级硬件上运行更大的模型。然而,本地推理速度受限于 GPU 的计算能力。与专用数据中心相比,生成文本的速度可能会较慢。

本地模型非常适合原型设计并确保数据主权。如果你正在构建私有知识库或处理敏感用户数据的工具,本地部署确保没有任何第三方看到你的输入。Ollama 还支持流式输出和函数调用,使其成为一个强大的本地服务器。然而,你必须自己管理环境、依赖项和硬件故障。

对于想要本地安装的简单性但又需要云 GPU 功率的用户,存在混合方法,但 Ollama 仍然是最直接的本地解决方案。

API 访问优势

使用托管 API 获取去对齐模型可提供多项技术优势,特别是在生产环境中。最显著的益处是与 OpenAI 兼容的接口。大多数去对齐 API 遵循 /v1/chat/completions 标准,这意味着您可以使用与 GPT-4 相同的 SDK 和代码。

兼容性: 您可以更改现有代码中的基础 URL 以指向去对齐提供商。这显著减少了集成时间。

功能: 现代 API 支持流式输出、函数调用和 JSON 模式。这允许您构建需要结构化输出或工具使用的复杂应用程序,就像使用商业模型一样。

可用性: 专业 API 提供商确保高可用性。您无需担心在关键请求期间本地 GPU 过热或电源故障。

隐私: 许多托管提供商(包括提供去对齐模型的提供商)不会使用您的提示词进行训练。这是希望在不牺牲数据隐私的情况下享受无审查模型优势的企业的关键卖点。

API 方法抽象了模型服务的复杂性,让你专注于应用逻辑。

成本对比

了解成本结构对于规划 LLM 使用预算至关重要。本地模型具有较高的固定成本和较低的可变成本。一旦购买 GPU,推理成本几乎是“免费”的,除了电费。托管 API 具有较低的固定成本,但按 token 收取可变费用。

本地成本: 单张 NVIDIA A100 GPU 的成本可能在 10,000 至 15,000 美元之间。您可以在其上运行多个模型,但受限于 VRAM。如果需要更多容量,您需要购买更多硬件。对于长期高用量使用,这是具有成本效益的。

API 成本: 托管 API 通常按每百万 token 收费。对于去对齐模型,价格通常低于商业模型,因为它们使用开放权重基础。例如,典型费率可能是每百万输入 token $0.25,每百万输出 token $1.00。这比 GPT-4o 便宜得多。

无订阅摩擦: 许多 API 提供商采用预付 token 模式。您购买额度,使用它,然后购买更多。没有月度费用或承诺。这对于具有使用高峰 followed by 闲置期的可变工作负载非常理想。

对于大多数开发者来说,除非你每天在专用集群上运行数百万次请求,否则 API 模式更具成本效益。

性能考量

在选择本地和托管方案时,延迟、吞吐量和上下文窗口大小等性能指标很重要。本地模型受限于硬件的计算能力和内存带宽。消费级 GPU 可能每秒生成 20 个 token,而数据中心 GPU 可以每秒生成数百个。

上下文窗口: 本地和托管模型都支持大上下文窗口,通常为 100k token 或更多。这允许您处理长文档或保持长对话历史。确保您的本地 GPU 有足够的 VRAM 来容纳完整的上下文。

延迟: 托管 API 除了计算时间外还有网络延迟(ping)。然而,数据中心针对低延迟推理进行了优化。本地模型具有近乎为零的网络延迟,但可能具有较高的计算延迟。

并发: 托管 API 可以处理数千个并发请求。本地模型受限于 GPU 的内存和计算核心。如果您需要同时为多个用户提供服务,托管 API 通常更具可扩展性。

对于实时应用,托管 API 通常由于更高的吞吐量和一致的性能而提供更流畅的用户体验。

无审查模型的使用场景

去对齐模型在拒绝成为麻烦的特定用例中表现出色。这些模型不仅用于 NSFW 内容;它们在需要原始、无过滤数据的领域表现出色。

  • 创意写作: 作家可以探索更黑暗或更复杂的主题,而无需模型打破角色或引用安全准则。
  • 情感分析: 无审查模型通常提供更诚实和细致的情感分析,因为它们不偏向积极或礼貌的响应。
  • 角色扮演: 对于聊天机器人和虚拟伴侣,去对齐模型能更好地保持角色,而不会中断流程来解释自己。
  • 数据提取: 当抓取或提取信息时,您希望模型输出所有相关内容,而不仅仅是“安全”部分。
  • 研究: 研究偏见或对齐的研究人员可以使用去对齐模型作为基线,与对齐模型进行比较。

关键在于你获得的是模型真实的输出分布,而不是经过平滑处理、人类批准版本。这对于真实性比礼貌更重要的应用来说是无价的。

决策矩阵

为了帮助你做出决定,这里有一个基于常见开发者需求的决策矩阵。考虑你的主要约束:是数据隐私、成本还是易用性?

优先级推荐方案原因
数据隐私本地 (Ollama)数据保留在你的机器上。
低前期成本托管 API无需购买硬件。
高可扩展性托管 API处理大量并发用户。
自定义控制本地完全控制模型和环境。
快速集成托管 APIOpenAI 兼容 SDK。

如果你正在构建原型或小应用,托管 API 通常是最佳的起点。如果隐私需求发生变化,你以后可以迁移到本地。相反,如果你正在处理敏感的法律或医疗数据,本地部署更安全。

问答

在 LLM 语境中,“去对齐”是什么意思?

去对齐是指从大型语言模型中移除对齐层的过程。这移除了导致模型拒绝某些主题的“拒绝”机制,从而产生一个更直接回答且不带礼貌过滤器的模型。

我可以使用 OpenAI SDK 使用去对齐 API 吗?

是的,大多数托管的去对齐 API 都与 OpenAI 兼容。您可以通过更改配置中的基础 URL 和 API 密钥来使用官方 OpenAI SDK。这允许您使用标准接口(如 /v1/chat/completions)配合无审查模型。

去对齐模型适合工作场所使用吗?

是的,但这取决于你的定义。如果受到提示,模型会生成 NSFW 内容,因此如果显示在共享屏幕上,可能不适合企业办公环境。然而,对于个人使用或你可以控制输出的特定应用来说,它完全安全。

我如何为 API 付费?

我们采用预付 token 模式。您可以使用加密货币(TRC20 上的 USDT 或 Base 上的 USDC)充值额度。没有月度订阅,未使用的额度不会过期。您只需为实际使用的 token 付费。

只差一张表单,即可获得密钥

创建账户,复制密钥,更改基础 URL。这就是整个设置过程。