繁中 ▾
取得 API 金鑰

無審查 LLM:選項比較

去對齊大型語言模型是移除了對齊層的基础模型,使其能在回答爭議性、成人內容或冷門問題時,避免標準商業模型常見的拒絕行為。本指南比較了本地運行這些模型與使用託管 API 之間的技術取捨,協助你為開發需求決定最佳的部署策略。

更新

重點

  • abliterated 模型移除了導致 Llama 3 或 Mistral 等基礎模型產生拒絕行為的「禮貌」過濾器。
  • 本地部署提供完全的隱私,但需要顯著的 GPU 硬體和維護開銷。
  • 託管 API 提供即時存取,並採用簡單的預付 token 計費方式,消除了基礎設施的複雜性。
  • 在本地與託管之間的選擇,取決於您在資料隱私、硬體成本與整合易用性之間的權衡。

什麼是無審查 LLM?

大型語言模型(LLM)通常會經過稱為「來自人類反饋的強化學習」(RLHF)的程序,以使其符合人類偏好。這種對齊使其變得禮貌、簡潔且安全,但也引入了拒絕行為。當你詢問對齊模型關於爭議性話題或要求成人內容時,它可能會拒絕,即使內容完全合法,也會援引安全指南。

去對齊大型語言模型是指移除了這些對齊層或進行「去對齊」處理的模型。這是透過從模型權重中減去對齊向量來完成的。結果是一個保留核心智慧與推理能力,但缺乏特定「拒絕」機制的模型。它會直接回答你的問題,無論主題是否敏感、性相關或具政治爭議,且不會出現典型的保留或說教。

  • 無拒絕: 模型根據其訓練資料而非安全過濾器來回答。
  • 原始輸出: 回應通常更直接,且較少針對人類閱讀進行格式化。
  • 基礎完整性: 底層的知識和邏輯保持完整,僅移除了「個性」過濾器。

此過程與微調不同。微調教導模型新技能,而 abliteration 僅移除約束。這使得 abliterated 模型成為開發者的理想選擇,他們希望進行原始資料提取或創意自由,而不受內容過濾器的干擾。

本地與託管部署

一旦您擁有 abliterated 模型,就需要一種運行方式。有兩種主要路徑:本地部署或使用託管 API。每種都有獨特的技術和經濟影響。

本地部署: 在自己的硬體上運行模型可讓您獲得絕對控制。您的資料不會離開您的機器,這對於隱私敏感的應用程式至關重要。然而,您需要負責硬體成本、電力、冷卻和更新。您需要大量的 VRAM;在本地運行 70B 參數模型可能需要多台高階 GPU。

託管 API: 託管服務在遠端伺服器上運行模型。您透過 HTTP 發送請求並接收回應。這消除了硬體管理並允許您即時擴展。您只需為使用的內容付費,通常是透過預付 token。代價是您的資料會經過第三方伺服器,儘管許多提供者不會使用您的提示詞進行訓練。

功能本地託管 API
資料隱私高中
前期成本高(硬體)低
擴展性由硬體固定高
維護自行管理提供者管理

對於大多數開發者而言,託管 API 提供了成本與便利性的最佳平衡,特別是在起步階段。

Ollama 與本地模型

Ollama 已成為在本地運行開源 LLM 的標準工具。它簡化了下載、量化和提供 Llama 3、Mistral 或 Qwen 等模型的過程。您可以輕鬆下載這些模型的 abliterated 版本,並透過本地 API 端點提供服務。

使用 Ollama,您可以透過簡單的指令如 ollama pull abliterated-model 來拉取模型。該工具處理量化,允許您在消費級硬體上運行更大的模型。然而,本地推理速度受您的 GPU 運算能力限制。與專用資料中心相比,生成文字的速度可能會較慢。

本地模型非常適合原型設計和確保資料主權。如果您正在建構私人知識庫或處理敏感使用者資料的工具,本地部署可確保沒有任何第三方看到您的輸入。Ollama 也支援串流輸出和函式呼叫,使其成為強大的本地伺服器。然而,您必須自行管理環境、相依性和硬體故障。

對於想要本地安裝的簡單性但又需要雲端 GPU 力量的使用者,存在混合方法,但 Ollama 仍然是最直接的本地解決方案。

API 存取優勢

使用託管式 API 來運行 abliterated 模型具有多項技術優勢,特別是在生產環境中。最顯著的優點是 OpenAI 相容的介面。大多數 abliterated API 遵循 /v1/chat/completions 標準,這表示你可以使用與 GPT-4 相同的 SDK 和程式碼。

相容性: 你可以在現有程式碼中更換基底 URL 以指向 abliterated 供應商。這能大幅減少整合時間。

功能: 現代 API 支援串流輸出、函式呼叫和 JSON 模式。這使你能夠建構需要結構化輸出或工具使用的複雜應用程式,就像使用商業模型一樣。

可用性: 專業的 API 供應商能確保高可用性。你無需擔心本地 GPU 過熱或電源供應器在關鍵請求期間故障。

隱私: 許多託管供應商(包括提供去對齊模型的供應商)不會將你的提示詞用於訓練。對於希望獲得無審查模型優勢又不犧牲資料隱私的企業而言,這是一個關鍵賣點。

API 方法抽象化了模型服務的複雜性,讓你能專注於應用程式邏輯。

成本比較

了解成本結構對於規劃 LLM 使用預算至關重要。本地模型具有高昂的固定成本,但邊際成本較低。一旦購買了 GPU,除了電費之外,推理是「免費」的。託管 API 則具有低固定成本,但每個 token 有變動成本。

本地成本: 一張 NVIDIA A100 GPU 的價格可能在 10,000 至 15,000 美元之間。你可以在上面運行多個模型,但會受到 VRAM 的限制。如果需要更多容量,必須購買更多硬體。對於長期大量使用來說,這具有成本效益。

API 成本: 託管 API 通常按百萬 token 收費。對於 abliterated 模型,價格通常低於商業模型,因為它們使用開放權重基底。例如,典型的費率可能是每百萬輸入 token 0.25 美元,每百萬輸出 token 1.00 美元。這比 GPT-4o 便宜得多。

無訂閱摩擦: 許多 API 供應商採用預付 token 模式。你購買額度、使用額度,然後再購買更多。沒有月費或承諾。這非常適合變動式工作負載,其中可能出現使用量激增後隨之而來的一段空閒期。

對於大多數開發人員來說,除非你每天在專用叢集上運行數百萬次請求,否則 API 模式更具成本效益。

效能考量

在選擇本地與託管之間時,延遲、吞吐量和上下文視窗大小等效能指標很重要。本地模型受限於硬體運算能力和記憶體頻寬。消費型 GPU 每秒可能產生 20 個 token,而資料中心 GPU 每秒可產生數百個。

上下文視窗: 本機與託管模型皆支援大型上下文視窗,通常可達 100k token 或更多。這使你能處理長文件或維持長對話歷史。請確保你的本機 GPU 擁有足夠的 VRAM 來容納完整的上下文。

延遲: 託管 API 除了運算時間外,還有網路延遲(ping)。然而,資料中心針對低延遲推理進行了最佳化。本地模型具有近乎零的網路延遲,但可能有較高的運算延遲。

並行請求: 託管 API 可以處理數千個並行請求。本地模型受限於 GPU 的記憶體和運算核心。如果你需要同時服務多個使用者,託管 API 通常更具擴展性。

對於即時應用程式,託管 API 通常由於更高的吞吐量和一致的效能而提供更流暢的使用者體驗。

無審查模型的用例

abliterated 模型在特定用例中表現出色,在這些用例中拒絕回應是一種干擾。這些模型不僅限於 NSFW 內容;它們在需要原始、無過濾資料的領域表現優異。

  • 創意寫作: 作家可以探索更黑暗或更複雜的主題,而不會導致模型崩潰或引用安全指南。
  • 情感分析: 無審查模型通常能提供更誠實且細緻的情感分析,因為它們不受偏向正面或禮貌回應的制約。
  • 角色扮演: 對於聊天機器人與虛擬伴侶,去對齊模型能更好地維持角色,不會為了自我解釋而中斷對話流程。
  • 資料擷取: 當爬取或擷取資訊時,你希望模型輸出所有相關內容,而不僅僅是「安全」的部分。
  • 研究: 研究偏見或對齊的研究人員可以使用去對齊模型作為基準,以與對齊模型進行比較。

關鍵在於你獲得模型的真實輸出分佈,而不是經過平滑處理、經人類批准的版本。對於真實性比禮貌更重要的應用程式來說,這非常有價值。

決策矩陣

為了幫助你做出決定,這裡有一個基於常見開發人員需求的決策矩陣。考慮你的主要限制:是資料隱私、成本還是易用性?

優先順序建議方法原因
資料隱私本地 (Ollama)資料保留在你的機器上。
低前期成本託管 API無需購買硬體。
高擴展性託管 API處理許多並行使用者。
自訂控制本地完全控制模型和環境。
快速整合託管 APIOpenAI 相容的 SDK。

如果你正在建構原型或小應用程式,託管 API 通常是最好的起點。如果你的隱私需求發生變化,你隨時可以遷移至本地。反之,如果你正在處理敏感的醫療或法律資料,本地部署更安全。

問答

在大型語言模型的語境中,「去對齊」意味著什麼?

去對齊是指從大型語言模型中移除對齊層的過程。這消除了導致模型拒絕特定主題的「拒絕」機制,從而產生一個回答更直接且沒有禮貌過濾器的模型。

我可以在 OpenAI SDK 中使用去對齊 API 嗎?

是的,大多數託管式去對齊 API 均與 OpenAI 相容。你可以透過修改設定中的基礎 URL 和 API 金鑰來使用官方 OpenAI SDK。這讓你能夠使用標準端點(如 /v1/chat/completions)搭配無審查模型。

去對齊模型適合工作環境嗎?

是的,但這取決於你的定義。如果受到提示,模型會生成 NSFW 內容,因此如果顯示在共用螢幕上,可能不適合企業辦公室環境。然而,對於個人使用或你可以控制輸出的特定應用程式來說,它完全安全。

我該如何為 API 付款?

我們採用預付 token 模式。你可以使用加密貨幣(TRC20 上的 USDT 或 Base 上的 USDC)為你的額度儲值。沒有月費,且未使用的額度不會過期。你只需為實際使用的 token 付費。

只差一張表單,即可取得金鑰

建立帳戶、複製金鑰、更改基底 URL。這就是整個設定過程。