TH ▾
รับคีย์ API

LLM แบบ Abliterated: การเปรียบเทียบตัวเลือก

LLLM ที่ผ่านการลบการปรับพฤติกรรมแล้วคือโมเดลพื้นฐานที่ชั้นการปรับพฤติกรรมถูกนำออก ทำให้สามารถตอบคำถามที่ถกเถียงได้ เนื้อสำหรับผู้ใหญ่ หรือคำถามเฉพาะทางได้โดยไม่มีการปฏิเสธแบบที่พบในโมเดลเชิงพาณิชย์มาตรฐาน คู่มือนี้เปรียบเทียบข้อแลกเปลี่ยนทางเทคนิคระหว่างการรันโมเดลเหล่านี้ในเครื่องของคุณเองกับการใช้ API ที่โฮสต์ไว้ เพื่อช่วยคุณตัดสินใจเลือกกลยุทธ์การปรับใช้ที่เหมาะสมที่สุดสำหรับความต้องการในการพัฒนาของคุณ

อัปเดต

จุดสำคัญ

  • โมเดลที่ผ่านการลบการปรับพฤติกรรมแล้วจะเอาตัวกรองความสุภาพออก ซึ่งเป็นสาเหตุที่ทำให้โมเดลพื้นฐานอย่าง Llama 3 หรือ Mistral ปฏิเสธการตอบคำถาม
  • การปรับใช้ในเครื่องให้ความเป็นส่วนตัวสูงสุดแต่ต้องการฮาร์ดแวร์ GPU และภาระการบำรุงรักษาที่สำคัญ
  • API แบบโฮสต์ให้การเข้าถึงทันทีด้วยการเรียกเก็บเงินโทเคนแบบเติมเงินล่วงหน้า ซึ่งขจัดความซับซ้อนของโครงสร้างพื้นฐาน
  • การเลือกระหว่างการปรับใช้ในเครื่องและแบบโฮสต์ขึ้นอยู่กับความสมดุลของคุณระหว่างความเป็นส่วนตัวของข้อมูล ต้นทุนฮาร์ดแวร์ และความง่ายในการผสานรวม

Abliterated LLM คืออะไร?

โมเดลภาษาขนาดใหญ่ (LLM) มักผ่านกระบวนการ Reinforcement Learning from Human Feedback (RLHF) เพื่อปรับให้สอดคล้องกับความต้องการของมนุษย์ การปรับนี้ทำให้โมเดลสุภาพ กระชับ และปลอดภัย แต่ก็นำไปสู่พฤติกรรมการปฏิเสธ เมื่อคุณถามโมเดลที่ผ่านการปรับแล้วเกี่ยวกับหัวข้อที่อ่อนไหวหรือขอเนื้อหา NSFW โมเดลอาจปฏิเสธโดยอ้างถึงแนวทางความปลอดภัย แม้เนื้อหานั้นจะถูกกฎหมายก็ตาม

LLLM ที่ผ่านการลบการปรับพฤติกรรมแล้ว คือโมเดลที่ชั้นการปรับพฤติกรรมเหล่านี้ถูกนำออกหรือ 'ลบการปรับพฤติกรรม' กระบวนการนี้ทำโดยการลบเวกเตอร์การปรับพฤติกรรมออกจากน้ำหนักของโมเดล ผลลัพธ์ที่ได้คือโมเดลที่รักษาความสามารถด้านสติปัญญาและการให้เหตุผลไว้ แต่ขาดกลไก 'การปฏิเสธ' เฉพาะเจาะจง โมเดลนี้จะตอบคำถามของคุณโดยตรง ไม่ว่าหัวข้อนั้นจะอ่อนไหว มีเนื้อหาทางเพศ หรือมีการเมืองเข้ามาเกี่ยวข้อง โดยไม่มีการเลี่ยงคำตอบหรือการสั่งสอนแบบทั่วไป

  • ไม่มีการปฏิเสธ: โมเดลตอบตามข้อมูลการฝึกฝนของมันแทนตัวกรองความปลอดภัย
  • ผลลัพธ์ดิบ: การตอบสนองมักจะตรงไปตรงมาและจัดรูปแบบสำหรับการบริโภคของมนุษย์น้อยลง
  • ความสมบูรณ์ของฐาน: ความรู้และตรรกะพื้นฐานยังคงอยู่ เหลือเพียงตัวกรอง 'บุคลิกภาพ' เท่านั้นที่ถูกนำออก

กระบวนการนี้แตกต่างจากการปรับแต่ง (fine-tuning) ในขณะที่การปรับสอนสอนโมเดลให้มีความสามารถใหม่ Abliteration เพียงแค่ลบข้อจำกัด ทำให้โมเดล Ablibrated เหมาะสมสำหรับนักพัฒนาที่ต้องการการดึงข้อมูลดิบหรืออิสระภาพในการสร้างสรรค์โดยไม่มีการรบกวนจากการกรองเนื้อหา

การปรับใช้ในเครื่อง vs แบบโฮสต์

เมื่อคุณมีโมเดล Ablibrated แล้ว คุณต้องการวิธีการรันมัน มีสองเส้นทางหลัก: การปรับใช้ในเครื่องหรือการใช้ API แบบโฮสต์ แต่ละวิธีมีนัยสำคัญทางเทคนิคและเศรษฐกิจที่แตกต่างกัน

การปรับใช้ในเครื่อง: การรันโมเดลบนฮาร์ดแวร์ของคุณเองทำให้คุณควบคุมได้อย่างสมบูรณ์ ข้อมูลของคุณจะไม่ออกจากเครื่องของคุณ ซึ่งสำคัญมากสำหรับแอปพลิเคชันที่อ่อนไหวต่อความเป็นส่วนตัว อย่างไรก็ตาม คุณต้องรับผิดชอบค่าใช้จ่ายด้านฮาร์ดแวร์ ไฟฟ้า การระบายความร้อน และการอัปเดต คุณต้องการ VRAM จำนวนมาก การรันโมเดลขนาด 70B พารามิเตอร์ในเครื่องอาจต้องการ GPU ระดับสูงหลายตัว

API แบบโฮสต์: บริการโฮสต์รันโมเดลบนเซิร์ฟเวอร์ระยะไกล คุณส่งคำขอผ่าน HTTP และรับผลลัพธ์ ซึ่งขจัดการจัดการฮาร์ดแวร์และอนุญาตให้คุณปรับขนาดได้ทันที คุณจ่ายเฉพาะสิ่งที่ใช้ โดยทั่วไปผ่านโทเคนแบบเติมเงินล่วงหน้า ข้อเสียเปรียบคือข้อมูลของคุณผ่านเซิร์ฟเวอร์ของบุคคลที่สาม แม้ว่าจะมีผู้ให้บริการจำนวนมากที่ไม่ใช้พรอมต์ของคุณสำหรับการฝึกฝน

คุณสมบัติในเครื่องAPI แบบโฮสต์
ความเป็นส่วนตัวของข้อมูลสูงปานกลาง
ต้นทุนเริ่มต้นสูง (ฮาร์ดแวร์)ต่ำ
ความสามารถในการปรับขนาดคงที่โดยฮาร์ดแวร์สูง
การบำรุงรักษาจัดการโดยตนเองจัดการโดยผู้ให้บริการ

สำหรับนักพัฒนาส่วนใหญ่ API แบบโฮสต์ให้ความสมดุลที่ดีที่สุดระหว่างต้นทุนและความสะดวก โดยเฉพาะเมื่อเริ่มต้น

Ollama และโมเดลในเครื่อง

Ollama ได้กลายเป็นเครื่องมือมาตรฐานสำหรับการรัน LLM แบบโอเพนซอร์สในเครื่องของคุณเอง มันทำให้กระบวนการดาวน์โหลด การทำควอนไทซ์ และการให้บริการโมเดลอย่าง Llama 3, Mistral หรือ Qwen ง่ายขึ้น คุณสามารถดาวน์โหลดเวอร์ชันที่ผ่านการลบการปรับพฤติกรรมแล้วของโมเดลเหล่านี้และให้บริการผ่านเอนด์พอยต์ API ในเครื่องของคุณได้อย่างง่ายดาย

การใช้ Ollama คุณสามารถดึงโมเดลด้วยคำสั่งง่ายๆ เช่น ollama pull abliterated-model เครื่องมือนี้จะจัดการการ quantize ทำให้คุณสามารถรันโมเดลขนาดใหญ่บนฮาร์ดแวร์ระดับผู้บริโภคได้ อย่างไรก็ตาม ความเร็วในการอนุมานในเครื่องจะถูกจำกัดด้วยพลังการคำนวณของ GPU การสร้างข้อความอาจช้ากว่าเมื่อเทียบกับศูนย์ข้อมูลเฉพาะทาง

โมเดลในเครื่องยอดเยี่ยมสำหรับการสร้างต้นแบบและรับประกันอำนาจอธิปไตยของข้อมูล หากคุณกำลังสร้างฐานความรู้ส่วนตัวหรือเครื่องมือที่ประมวลผลข้อมูลผู้ใช้ที่ละเอียดอ่อน การปรับใช้ในเครื่องรับประกันว่าไม่มีบุคคลที่สามเห็นข้อมูลนำเข้าของคุณ Ollama ยังรองรับสตรีมมิงและการเรียกใช้ฟังก์ชัน ทำให้เป็นเซิร์ฟเวอร์ในเครื่องที่แข็งแกร่ง อย่างไรก็ตาม คุณต้องจัดการสภาพแวดล้อม การพึ่งพา และข้อผิดพลาดของฮาร์ดแวร์ด้วยตนเอง

สำหรับผู้ใช้ที่ต้องการความเรียบง่ายของการติดตั้งในเครื่องแต่พลังของ GPU คลาวด์ มีแนวทางแบบไฮบริด แต่ Ollama ยังคงเป็นโซลูชันในเครื่องที่ตรงไปตรงมาที่สุด

ข้อดีของการเข้าถึง API

การใช้ API ที่โฮสต์ไว้สำหรับโมเดลที่ผ่านการลบการปรับพฤติกรรมแล้วมีข้อดีทางเทคนิคหลายประการ โดยเฉพาะสำหรับสภาพแวดล้อมการผลิต ข้อได้เปรียบที่สำคัญที่สุดคืออินเทอร์เฟซที่เข้ากันได้กับ OpenAI API ที่ผ่านการลบการปรับพฤติกรรมแล้วส่วนใหญ่ปฏิบัติตามมาตรฐาน /v1/chat/completions ซึ่งหมายความว่าคุณสามารถใช้ SDK และโค้ดเดียวกับที่ใช้กับ GPT-4 ได้

ความเข้ากันได้: คุณสามารถเปลี่ยน URL พื้นฐานในโค้ดที่มีอยู่ของคุณให้ชี้ไปยังผู้ให้บริการที่ผ่านการลบการปรับพฤติกรรมแล้ว ซึ่งช่วยลดเวลาในการผสานรวมได้อย่างมาก

คุณสมบัติ: API แบบ Modern รองรับสตรีมมิงการตอบกลับ การเรียกใช้ฟังก์ชัน และโหมด JSON สิ่งนี้ทำให้คุณสามารถสร้างแอปพลิเคชันที่ซับซ้อนซึ่งต้องการผลลัพธ์ที่มีโครงสร้างหรือการใช้เครื่องมือได้ เช่นเดียวกับที่คุณทำกับโมเดลพาณิชย์

เวลาทำงาน: ผู้ให้บริการ API มืออาชีพรับประกันความพร้อมใช้งานสูง คุณไม่จำเป็นต้องกังวลเกี่ยวกับ GPU ในเครื่องของคุณร้อนเกินไปหรือแหล่งจ่ายไฟล้มเหลวระหว่างคำขอที่สำคัญ

ความเป็นส่วนตัว: ผู้ให้บริการแบบโฮสต์จำนวนมาก รวมถึงผู้ให้บริการที่เสนอโมเดลแบบ abliterated ไม่ใช้พรอมต์ของคุณสำหรับการฝึกฝน นี่คือจุดขายสำคัญสำหรับธุรกิจที่ต้องการประโยชน์ของโมเดลที่ไม่เซ็นเซอร์โดยไม่เสียความเป็นส่วนตัวของข้อมูล

แนวทาง API ช่วยลดความซับซ้อนของการให้บริการโมเดล ทำให้คุณสามารถมุ่งเน้นไปที่ตรรกะของแอปพลิเคชันของคุณได้

การเปรียบเทียบต้นทุน

ความเข้าใจโครงสร้างต้นทุนเป็นสิ่งสำคัญสำหรับการวางแผนงบประมาณสำหรับการใช้งาน LLM ของคุณ โมเดลในเครื่องมีต้นทุนคงที่สูงแต่ต้นทุนส่วนเพิ่มต่ำ เมื่อคุณซื้อ GPU แล้ว การอนุมานจะ 'ฟรี' นอกเหนือจากค่าไฟฟ้า API แบบโฮสต์มีต้นทุนคงที่ต่ำแต่มีต้นทุนแปรผันต่อโทเคน

ต้นทุนในเครื่อง: GPU NVIDIA A100 ตัวเดียวอาจมีราคา $10,000-$15,000 คุณสามารถรันโมเดลหลายตัวบนมันได้ แต่คุณจะถูกจำกัดด้วย VRAM หากคุณต้องการความจุมากขึ้น คุณต้องซื้อฮาร์ดแวร์เพิ่มเติม สิ่งนี้มีประสิทธิภาพด้านต้นทุนสำหรับการใช้งานปริมาณสูงเป็นระยะเวลานาน

ต้นทุน API: API ที่โฮสต์ไว้มักคิดค่าบริการต่อล้านโทเคน สำหรับโมเดลที่ผ่านการลบการปรับพฤติกรรมแล้ว ราคาจะถูกกว่าโมเดลเชิงพาณิชย์เนื่องจากใช้โมเดลพื้นฐานแบบเปิดน้ำหนัก ตัวอย่างเช่น อัตราทั่วไปอาจอยู่ที่ $0.25 ต่อล้านโทเคนอินพุต และ $1.00 ต่อล้านโทเคนเอาต์พุต ซึ่งถูกกว่า GPT-4o อย่างมีนัยสำคัญ

ไม่มีอุปสรรคในการสมัครสมาชิก: ผู้ให้บริการ API หลายรายใช้โมเดลโทเคนแบบเติมเงินล่วงหน้า คุณซื้อเครดิต ใช้แล้วซื้อเพิ่ม ไม่มีค่าธรรมเนียมรายเดือนหรือพันธะสัญญา สิ่งนี้เหมาะสำหรับภาระงานที่เปลี่ยนแปลงได้ซึ่งคุณอาจมีการใช้งานเพิ่มขึ้นตามด้วยการหยุดทำงานเป็นระยะ

สำหรับนักพัฒนาส่วนใหญ่ โมเดล API มีประสิทธิภาพด้านต้นทุนมากกว่า เว้นแต่คุณจะรันคำขอหลายล้านคำต่อวันบนคลัสเตอร์เฉพาะ

ข้อพิจารณาเกี่ยวกับประสิทธิภาพ

เมื่อเลือกระหว่างในเครื่องและแบบโฮสต์ ตัวชี้วัดประสิทธิภาพเช่น latency throughput และขนาดหน้าต่างบริบทมีความสำคัญ โมเดลในเครื่องถูกจำกัดด้วยพลังการคำนวณและแบนด์วิดท์หน่วยความจำของฮาร์ดแวร์ของคุณ GPU ระดับผู้บริโภคอาจสร้าง 20 โทเคนต่อวินาที ในขณะที่ GPU ศูนย์ข้อมูลสามารถสร้างได้หลายร้อย

หน้าต่างบริบท: โมเดลทั้งในเครื่องและแบบโฮสต์รองรับหน้าต่างบริบทขนาดใหญ่ มักจะ 100k โทเคนขึ้นไป สิ่งนี้ทำให้คุณสามารถประมวลผลเอกสารยาวหรือรักษาประวัติการสนทนาที่ยาวนานได้ ตรวจสอบให้แน่ใจว่า GPU ในเครื่องของคุณมี VRAM เพียงพอที่จะเก็บบริบททั้งหมด

ความหน่วง: API แบบโฮสต์มีความหน่วงของเครือข่าย (ping) นอกเหนือจากเวลาในการคำนวณ อย่างไรก็ตาม ศูนย์ข้อมูลได้รับการปรับแต่งสำหรับการอนุมานที่มีความหน่วงต่ำ โมเดลในเครื่องมีความหน่วงของเครือข่ายเกือบเป็นศูนย์แต่อาจมีความหน่วงในการคำนวณที่สูงกว่า

ความพร้อมใช้งานพร้อมกัน: API แบบโฮสต์สามารถจัดการคำขอพร้อมกันหลายพันรายการ โมเดลในเครื่องถูกจำกัดด้วยหน่วยความจำและคอร์การคำนวณของ GPU หากคุณต้องการให้บริการผู้ใช้หลายรายพร้อมกัน API แบบโฮสต์โดยทั่วไปจะปรับขนาดได้ดีกว่า

สำหรับแอปพลิเคชันแบบเรียลไทม์ API แบบโฮสต์มักมอบประสบการณ์ผู้ใช้ที่ลื่นไหลกว่าเนื่องจากอัตราการส่งข้อมูลที่สูงกว่าและประสิทธิภาพที่สม่ำเสมอ

กรณีการใช้งานสำหรับโมเดลที่ไม่เซ็นเซอร์

โมเดลที่ผ่านการลบการปรับแต่งแล้ว (abliterated) มีความโดดเด่นในกรณีการใช้งานเฉพาะที่การปฏิเสธเป็นปัญหา โมเดลเหล่านี้ไม่ได้มีไว้สำหรับเนื้อหา NSFW เท่านั้น แต่ยังยอดเยี่ยมในพื้นที่ที่ต้องการข้อมูลดิบที่ไม่มีการกรอง

  • การเขียนเชิงสร้างสรรค์: นักเขียนสามารถสำรวจธีมที่มืดมนหรือซับซ้อนมากขึ้นได้โดยที่โมเดลไม่เสียบุคลิกหรืออ้างอิงแนวทางความปลอดภัย
  • การวิเคราะห์ความรู้สึก: โมเดลแบบไม่เซ็นเซอร์มักจะให้การวิเคราะห์ความรู้สึกที่ตรงไปตรงมาและละเอียดอ่อนมากขึ้น เนื่องจากไม่มีความลำเอียงไปทางคำตอบเชิงบวกหรือสุภาพ
  • บทบาทสมมติ: สำหรับแชทบอทและเพื่อนคู่สนทนาเสมือน โมเดล Ablibrated รักษาตัวละครได้ดีกว่าโดยไม่หยุดการไหลของบทสนทนาเพื่ออธิบายตัวเอง
  • การดึงข้อมูล: เมื่อทำการดึงข้อมูลหรือสกัดข้อมูล คุณต้องการให้โมเดลเอาต์พุตข้อมูลที่เกี่ยวข้องทั้งหมด ไม่ใช่แค่ส่วนที่ 'ปลอดภัย'
  • การวิจัย: นักวิจัยที่ศึกษาความลำเอียงหรือการปรับทิศทางสามารถใช้โมเดล Ablibrated เป็นพื้นฐานเพื่อเปรียบเทียบกับโมเดลที่ผ่านการปรับทิศทางแล้ว

กุญแจสำคัญคือคุณได้รับการกระจายเอาต์พุตที่แท้จริงของโมเดล ไม่ใช่เวอร์ชันที่เรียบเนียนและผ่านการอนุมัติจากมนุษย์ สิ่งนี้มีคุณค่าอย่างยิ่งสำหรับแอปพลิเคชันที่ความแท้จริงสำคัญกว่าความสุภาพ

เมทริกซ์การตัดสินใจ

เพื่อช่วยคุณตัดสินใจ นี่คือเมทริกซ์การตัดสินใจที่อิงตามความต้องการทั่วไปของนักพัฒนา พิจารณาข้อจำกัดหลักของคุณ: คือความเป็นส่วนตัวของข้อมูล ต้นทุน หรือความง่ายในการใช้งาน?

ลำดับความสำคัญแนวทางที่แนะนำเหตุผล
ความเป็นส่วนตัวของข้อมูลในเครื่อง (Ollama)ข้อมูลอยู่ในเครื่องของคุณ
ต้นทุนเริ่มต้นต่ำAPI แบบโฮสต์ไม่ต้องซื้อฮาร์ดแวร์
ความสามารถในการปรับขนาดสูงAPI แบบโฮสต์จัดการผู้ใช้พร้อมกันจำนวนมากได้
การควบคุมแบบกำหนดเองในเครื่องควบคุมโมเดลและสภาพแวดล้อมได้เต็มที่
การผสานรวมอย่างรวดเร็วAPI แบบโฮสต์SDK ที่เข้ากันได้กับ OpenAI

หากคุณกำลังสร้างโปรโตไทป์หรือแอปพลิเคชันขนาดเล็ก API แบบโฮสต์มักจะเป็นจุดเริ่มต้นที่ดีที่สุด คุณสามารถย้ายไปใช้แบบในเครื่องได้เสมอหากความต้องการความเป็นส่วนตัวของคุณเปลี่ยนแปลง ในทางกลับกัน หากคุณกำลังประมวลผลข้อมูลทางกฎหมายหรือการแพทย์ที่อ่อนไหว การปรับใช้ในเครื่องปลอดภัยกว่า

ถาม-ตอบ

'abliterated' หมายถึงอะไรในบริบทของ LLM?

Abliteration หมายถึงกระบวนการถอดชั้นการปรับทิศทางออกจากโมเดลภาษาขนาดใหญ่ สิ่งนี้ลบกลไก 'การปฏิเสธ' ที่ทำให้โมเดลปฏิเสธหัวข้อบางหัวข้อ ส่งผลให้ได้โมเดลที่ตอบคำถามได้ตรงไปตรงมาและไม่มีตัวกรองความสุภาพ

ฉันสามารถใช้ API แบบ abliterated กับ OpenAI SDK ได้หรือไม่?

ใช่ API แบบโฮสต์แบบ abliterated ส่วนใหญ่เข้ากันได้กับ OpenAI คุณสามารถใช้ OpenAI SDK ทางการได้โดยเปลี่ยน URL ฐานและคีย์ API ในการกำหนดค่าของคุณ สิ่งนี้ทำให้คุณสามารถใช้เอนด์พอยต์มาตรฐานเช่น /v1/chat/completions กับโมเดลที่ไม่เซ็นเซอร์ได้

โมเดล Ablibrated เหมาะสมกับที่ทำงานหรือไม่?

ใช่ แต่ขึ้นอยู่กับคำจำกัดความของคุณ โมเดลจะสร้างเนื้อหา NSFW หากได้รับพรอมต์ ดังนั้นอาจไม่เหมาะสำหรับสำนักงานองค์กรหากแสดงบนหน้าจอร่วม อย่างไรก็ตาม มันปลอดภัยสำหรับการใช้งานส่วนบุคคลหรือแอปพลิเคชันเฉพาะที่คุณควบคุมเอาต์พุต

ฉันจะชำระเงินสำหรับ API ได้อย่างไร?

เราใช้โมเดลโทเคนแบบเติมเงินล่วงหน้า คุณสามารถเติมเงินเครดิตของคุณโดยใช้คริปโต (USDT บน TRC20 หรือ USDC บน Base) ไม่มีสมาชิกแบบรายเดือน และเครดิตที่ไม่ได้ใช้จะไม่หมดอายุ คุณจ่ายเฉพาะโทเคนที่คุณใช้งานจริงเท่านั้น

คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว

สร้างบัญชี คัดลอกคีย์ เปลี่ยน URL ฐาน นั่นคือการตั้งค่าทั้งหมด