VI ▾
Lấy khóa API

LLM đã loại bỏ kiểm duyệt: So sánh các tùy chọn

LLM đã loại bỏ kiểm duyệt là một mô hình cơ sở đã được loại bỏ các lớp căn chỉnh, cho phép nó trả lời các câu hỏi gây tranh cãi, NSFW hoặc chuyên biệt mà không bị từ chối như các mô hình thương mại tiêu chuẩn. Hướng dẫn này so sánh các sự đánh đổi kỹ thuật giữa việc chạy các mô hình này cục bộ so với việc sử dụng API được lưu trữ, giúp bạn quyết định chiến lược triển khai tốt nhất cho nhu cầu phát triển của bạn.

Cập nhật

Điểm chính

  • Các mô hình đã loại bỏ kiểm duyệt loại bỏ các bộ lọc 'lịch sự' gây ra việc từ chối trong các mô hình cơ sở như Llama 3 hoặc Mistral.
  • Triển khai cục bộ cung cấp quyền riêng tư hoàn toàn nhưng yêu cầu phần cứng GPU đáng kể và chi phí bảo trì.
  • API lưu trữ cung cấp quyền truy cập ngay lập tức với hóa đơn token trả trước đơn giản, loại bỏ sự phức tạp về cơ sở hạ tầng.
  • Sự lựa chọn giữa cục bộ và lưu trữ phụ thuộc vào sự cân bằng của bạn giữa quyền riêng tư dữ liệu, chi phí phần cứng và khả năng tích hợp dễ dàng.

LLM Ablivered là gì?

Các mô hình ngôn ngữ lớn (LLM) thường trải qua một quá trình được gọi là Học tăng cường từ phản hồi của con người (RLHF) để căn chỉnh chúng với sở thích của con người. Sự căn chỉnh này khiến chúng lịch sự, súc tích và an toàn, nhưng nó cũng giới thiệu các hành vi từ chối. Khi bạn hỏi một mô hình đã căn chỉnh về một chủ đề gây tranh cãi hoặc yêu cầu nội dung NSFW, nó có thể từ chối, trích dẫn các hướng dẫn an toàn ngay cả khi nội dung hoàn toàn hợp pháp.

Một LLM đã loại bỏ kiểm duyệt là một mô hình đã được loại bỏ hoặc 'abliterated' các lớp căn chỉnh này. Điều này được thực hiện bằng cách trừ vector căn chỉnh khỏi trọng số của mô hình. Kết quả là một mô hình giữ lại trí thông minh và khả năng suy luận cốt lõi nhưng thiếu các cơ chế 'từ chối' cụ thể. Nó sẽ trả lời câu hỏi của bạn một cách trực tiếp, bất kể chủ đề có nhạy cảm, tình dục hay mang tính chính trị, mà không có sự do dự hoặc giảng dạy điển hình.

  • Không từ chối: Mô hình trả lời dựa trên dữ liệu đào tạo của nó thay vì bộ lọc an toàn.
  • Đầu ra thô: Các phản hồi thường trực tiếp hơn và ít được định dạng để con người tiêu thụ.
  • Tính toàn vẹn cơ sở: Kiến thức và logic nền tảng vẫn được giữ nguyên, chỉ có bộ lọc 'tính cách' được loại bỏ.

Quá trình này khác với fine-tuning. Trong khi fine-tuning dạy một mô hình các kỹ năng mới, abliteration chỉ đơn giản là loại bỏ các ràng buộc. Điều này khiến các mô hình ablivered lý tưởng cho các nhà phát triển muốn trích xuất dữ liệu thô hoặc tự do sáng tạo mà không bị cản trở bởi bộ lọc nội dung.

Triển khai cục bộ so với lưu trữ

Khi bạn có một mô hình ablivered, bạn cần một cách để chạy nó. Có hai con đường chính: triển khai cục bộ hoặc sử dụng API lưu trữ. Mỗi con đường có những hàm ý kỹ thuật và kinh tế riêng biệt.

Triển khai cục bộ: Chạy một mô hình trên phần cứng của riêng bạn cho bạn quyền kiểm soát tuyệt đối. Dữ liệu của bạn không bao giờ rời khỏi máy của bạn, điều này rất quan trọng đối với các ứng dụng nhạy cảm về quyền riêng tư. Tuy nhiên, bạn chịu trách nhiệm về chi phí phần cứng, điện, làm mát và bản cập nhật. Bạn cần VRAM đáng kể; chạy một mô hình 70B tham số cục bộ có thể yêu cầu nhiều GPU cao cấp.

API lưu trữ: Một dịch vụ lưu trữ chạy mô hình trên các máy chủ từ xa. Bạn gửi yêu cầu qua HTTP và nhận phản hồi. Điều này loại bỏ việc quản lý phần cứng và cho phép bạn mở rộng ngay lập tức. Bạn chỉ trả tiền cho những gì bạn sử dụng, thường là thông qua token trả trước. Sự đánh đổi là dữ liệu của bạn đi qua máy chủ của bên thứ ba, mặc dù nhiều nhà cung cấp không sử dụng prompt của bạn để đào tạo.

Tính năngCục bộAPI lưu trữ
Quyền riêng tư dữ liệuCaoTrung bình
Chi phí ban đầuCao (Phần cứng)Thấp
Khả năng mở rộngCố định bởi Phần cứngCao
Bảo trìTự quản lýNhà cung cấp quản lý

Đối với hầu hết các nhà phát triển, một API lưu trữ cung cấp sự cân bằng tốt nhất giữa chi phí và sự tiện lợi, đặc biệt là khi bắt đầu.

Ollama và mô hình cục bộ

Ollama đã trở thành công cụ tiêu chuẩn để chạy các LLM mã nguồn mở cục bộ. Nó đơn giản hóa quá trình tải xuống, lượng tử hóa và phục vụ các mô hình như Llama 3, Mistral hoặc Qwen. Bạn có thể dễ dàng tải xuống phiên bản đã loại bỏ kiểm duyệt của các mô hình này và phục vụ chúng qua một endpoint API cục bộ.

Sử dụng Ollama, bạn có thể kéo một mô hình bằng lệnh đơn giản như ollama pull abliterated-model. Công cụ này xử lý việc lượng tử hóa, cho phép bạn chạy các mô hình lớn hơn trên phần cứng tiêu dùng. Tuy nhiên, tốc độ suy luận cục bộ bị giới hạn bởi sức mạnh tính toán của GPU của bạn. Việc tạo văn bản có thể chậm hơn so với một trung tâm dữ liệu chuyên dụng.

Các mô hình cục bộ rất tuyệt vời để tạo mẫu và đảm bảo chủ quyền dữ liệu. Nếu bạn đang xây dựng cơ sở kiến thức riêng hoặc một công cụ xử lý dữ liệu người dùng nhạy cảm, việc triển khai cục bộ đảm bảo rằng không bên thứ ba nào nhìn thấy đầu vào của bạn. Ollama cũng hỗ trợ truyền phát và gọi công cụ, khiến nó trở thành máy chủ cục bộ mạnh mẽ. Tuy nhiên, bạn phải tự quản lý môi trường, phần phụ thuộc và lỗi phần cứng.

Đối với người dùng muốn sự đơn giản của cài đặt cục bộ nhưng sức mạnh của GPU đám mây, các phương pháp lai tồn tại, nhưng Ollama vẫn là giải pháp cục bộ đơn giản nhất.

Lợi ích truy cập API

Sử dụng API được lưu trữ cho một mô hình đã loại bỏ kiểm duyệt mang lại nhiều lợi ích kỹ thuật, đặc biệt là cho các môi trường sản xuất. Lợi ích đáng kể nhất là giao diện tương thích với OpenAI. Hầu hết các API đã loại bỏ kiểm duyệt tuân theo tiêu chuẩn /v1/chat/completions, có nghĩa là bạn có thể sử dụng cùng các SDK và mã mà bạn sẽ sử dụng cho GPT-4.

Tương thích: Bạn có thể thay đổi URL cơ sở trong mã hiện có của mình để trỏ đến nhà cung cấp đã loại bỏ kiểm duyệt. Điều này giảm đáng kể thời gian tích hợp.

Tính năng: Các API hiện đại hỗ trợ phản hồi truyền phát (streaming), gọi hàm và chế độ JSON. Điều này cho phép bạn xây dựng các ứng dụng phức tạp yêu cầu đầu ra có cấu trúc hoặc sử dụng công cụ, giống như bạn vẫn làm với các mô hình thương mại.

Thời gian hoạt động: Một nhà cung cấp API chuyên nghiệp đảm bảo tính sẵn sàng cao. Bạn không cần phải lo lắng về việc GPU cục bộ của bạn bị quá nhiệt hoặc nguồn điện bị hỏng trong khi xử lý một yêu cầu quan trọng.

Quyền riêng tư: Nhiều nhà cung cấp lưu trữ, bao gồm cả những nhà cung cấp mô hình loại bỏ kiểm duyệt, không sử dụng prompt của bạn để huấn luyện. Đây là điểm bán hàng chính cho các doanh nghiệp muốn tận dụng lợi ích của mô hình không kiểm duyệt mà không hy sinh quyền riêng tư dữ liệu.

Phương pháp API trừu tượng hóa sự phức tạp của việc phục vụ mô hình, cho phép bạn tập trung vào logic ứng dụng của mình.

So sánh chi phí

Hiểu rõ cấu trúc chi phí là rất quan trọng để lập ngân sách cho việc sử dụng LLM của bạn. Các mô hình cục bộ có chi phí cố định cao nhưng chi phí biên thấp. Một khi bạn đã mua GPU, việc suy luận là 'miễn phí' ngoài tiền điện. Các API lưu trữ có chi phí cố định thấp nhưng chi phí biến đổi trên mỗi token.

Chi phí cục bộ: Một GPU NVIDIA A100 đơn lẻ có thể có giá từ $10.000 đến $15.000. Bạn có thể chạy nhiều mô hình trên đó, nhưng bạn bị giới hạn bởi VRAM. Nếu cần nhiều dung lượng hơn, bạn sẽ mua thêm phần cứng. Đây là giải pháp hiệu quả về chi phí cho các trường hợp sử dụng khối lượng lớn trong thời gian dài.

Chi phí API: Các API được lưu trữ thường tính phí theo mỗi triệu token. Đối với mô hình abliterated, giá thường thấp hơn các mô hình thương mại vì chúng sử dụng các mô hình trọng số mở. Ví dụ, mức giá điển hình có thể là $0,25 cho mỗi triệu token đầu vào và $1,00 cho mỗi triệu token đầu ra. Điều này rẻ hơn đáng kể so với GPT-4o.

Không rào cản đăng ký: Nhiều nhà cung cấp API sử dụng mô hình token trả trước. Bạn mua tín dụng, sử dụng và mua thêm. Không có phí hàng tháng hay cam kết. Điều này lý tưởng cho các khối lượng công việc biến động, nơi bạn có thể có các đỉnh sử dụng theo sau là các giai đoạn không hoạt động.

Đối với hầu hết các nhà phát triển, mô hình API hiệu quả về chi phí hơn trừ khi bạn đang xử lý hàng triệu yêu cầu mỗi ngày trên một cụm chuyên dụng.

Xem xét hiệu suất

Khi lựa chọn giữa cục bộ và lưu trữ, các chỉ số hiệu suất như độ trễ, thông lượng và kích thước cửa sổ ngữ cảnh đều quan trọng. Các mô hình cục bộ bị giới hạn bởi khả năng tính toán và băng thông bộ nhớ của phần cứng của bạn. Một GPU tiêu dùng có thể tạo ra 20 token mỗi giây, trong khi một GPU trung tâm dữ liệu có thể tạo ra hàng trăm.

Cửa sổ ngữ cảnh: Cả các mô hình chạy cục bộ và được lưu trữ đều hỗ trợ cửa sổ ngữ cảnh lớn, thường là 100k token trở lên. Điều này cho phép bạn xử lý các tài liệu dài hoặc duy trì lịch sử hội thoại dài. Đảm bảo GPU cục bộ của bạn có đủ VRAM để chứa toàn bộ ngữ cảnh.

Độ trễ: Các API được lưu trữ có độ trễ mạng (ping) ngoài thời gian tính toán. Tuy nhiên, các trung tâm dữ liệu được tối ưu hóa cho suy luận độ trễ thấp. Các mô hình cục bộ có độ trễ mạng gần như bằng không nhưng có thể có độ trễ tính toán cao hơn.

Yêu cầu đồng thời: Các API được lưu trữ có thể xử lý hàng nghìn yêu cầu đồng thời. Các mô hình cục bộ bị giới hạn bởi bộ nhớ và lõi tính toán của GPU của bạn. Nếu bạn cần phục vụ nhiều người dùng cùng lúc, một API được lưu trữ thường có khả năng mở rộng tốt hơn.

Đối với các ứng dụng thời gian thực, một API lưu trữ thường mang lại trải nghiệm người dùng mượt mà hơn nhờ thông lượng cao hơn và hiệu suất ổn định.

Các trường hợp sử dụng cho các mô hình không kiểm duyệt

Các mô hình đã loại bỏ kiểm duyệt tỏa sáng trong các trường hợp sử dụng cụ thể nơi mà việc từ chối là một phiền toái. Những mô hình này không chỉ dành cho nội dung NSFW; chúng xuất sắc trong các lĩnh vực yêu cầu dữ liệu thô, không được lọc.

  • Viết sáng tạo: Các nhà văn có thể khám phá các chủ đề tối hơn hoặc phức tạp hơn mà không làm mô hình mất vai diễn hoặc trích dẫn các hướng dẫn an toàn.
  • Phân tích cảm xúc: Các mô hình không kiểm duyệt thường cung cấp phân tích cảm xúc trung thực và tinh tế hơn, vì chúng không bị thiên vị về các phản ứng tích cực hoặc lịch sự.
  • Đóng vai: Đối với chatbot và người bạn ảo, các mô hình đã loại bỏ kiểm duyệt duy trì vai diễn tốt hơn mà không làm gián đoạn dòng chảy để giải thích bản thân.
  • Trích xuất dữ liệu: Khi thu thập hoặc trích xuất thông tin, bạn muốn mô hình xuất ra mọi thứ liên quan, không chỉ các phần 'an toàn'.
  • Nghiên cứu: Các nhà nghiên cứu nghiên cứu về thiên vị hoặc căn chỉnh có thể sử dụng các mô hình đã loại bỏ kiểm duyệt làm đường cơ sở để so sánh với các mô hình đã căn chỉnh.

Chìa khóa ở đây là bạn nhận được phân phối đầu ra thực sự của mô hình, không phải phiên bản đã được làm mượt, được con người phê duyệt. Điều này vô cùng quý giá cho các ứng dụng nơi tính xác thực quan trọng hơn sự lịch sự.

Ma trận quyết định

Để giúp bạn quyết định, đây là một ma trận quyết định dựa trên các nhu cầu phát triển phổ biến. Hãy xem xét ràng buộc chính của bạn: đó là quyền riêng tư dữ liệu, chi phí hay sự dễ sử dụng?

Ưu tiênPhương pháp được khuyến nghịLý do
Quyền riêng tư dữ liệuCục bộ (Ollama)Dữ liệu vẫn ở trên máy của bạn.
Chi phí đầu vào thấpAPI lưu trữKhông cần mua phần cứng.
Khả năng mở rộng caoAPI lưu trữXử lý nhiều người dùng đồng thời.
Kiểm soát tùy chỉnhCục bộKiểm soát đầy đủ đối với mô hình và môi trường.
Tích hợp nhanhAPI lưu trữSDK tương thích với OpenAI.

Nếu bạn đang xây dựng một nguyên mẫu hoặc một ứng dụng nhỏ, một API lưu trữ thường là điểm bắt đầu tốt nhất. Bạn luôn có thể chuyển sang cục bộ sau này nếu nhu cầu về quyền riêng tư của bạn thay đổi. Ngược lại, nếu bạn đang xử lý dữ liệu pháp lý hoặc y tế nhạy cảm, việc triển khai cục bộ an toàn hơn.

Hỏi đáp

'Loại bỏ kiểm duyệt' có nghĩa là gì trong ngữ cảnh LLM?

Loại bỏ kiểm duyệt đề cập đến quá trình loại bỏ các lớp phù hợp khỏi một mô hình ngôn ngữ lớn. Điều này loại bỏ các cơ chế 'từ chối' khiến mô hình từ chối một số chủ đề nhất định, dẫn đến một mô hình trả lời trực tiếp hơn và không có bộ lọc lịch sự.

Tôi có thể sử dụng API loại bỏ kiểm duyệt với SDK OpenAI không?

Đúng vậy, hầu hết các API đã loại bỏ kiểm duyệt được lưu trữ đều tương thích với OpenAI. Bạn có thể sử dụng SDK chính thức của OpenAI bằng cách thay đổi URL cơ sở và khóa API trong cấu hình của mình. Điều này cho phép bạn sử dụng các endpoint tiêu chuẩn như /v1/chat/completions với một mô hình không kiểm duyệt.

Mô hình loại bỏ kiểm duyệt có an toàn cho môi trường làm việc không?

Có, nhưng nó phụ thuộc vào định nghĩa của bạn. Mô hình sẽ tạo ra nội dung NSFW nếu được yêu cầu, vì vậy nó có thể không phù hợp cho một môi trường văn phòng doanh nghiệp nếu được hiển thị trên màn hình chia sẻ. Tuy nhiên, nó hoàn toàn an toàn cho việc sử dụng cá nhân hoặc các ứng dụng cụ thể nơi bạn kiểm soát đầu ra.

Tôi thanh toán cho API như thế nào?

Chúng tôi sử dụng mô hình token trả trước. Bạn có thể nạp tiền vào tín dụng của mình bằng tiền điện tử (USDT trên TRC20 hoặc USDC trên Base). Không có đăng ký hàng tháng và tín dụng chưa sử dụng không bao giờ hết hạn. Bạn chỉ trả tiền cho các token bạn thực sự sử dụng.

Khóa của bạn chỉ cách một biểu mẫu

Tạo tài khoản, sao chép khóa, thay đổi URL cơ sở. Đó là toàn bộ quá trình thiết lập.