บล็อก
บันทึกว่าด้วย inference แบบไม่เซ็นเซอร์ — red-teaming, benchmark อัตราการปฏิเสธ และการรัน API ในโปรดักชัน
-
โมเดล abliterated คืออะไร
Abliteration หาทิศทางการปฏิเสธใน residual stream ของโมเดลแล้วฉายมันออกจาก weights — ไม่ต้องเทรนใหม่ ไม่ต้องใช้ทริกใน prompt
-
API ของ LLM แบบไม่เซ็นเซอร์สำหรับ Red-Teaming และงานวิจัยด้านความปลอดภัย
เมื่อโมเดล attacker ปฏิเสธ คุณกำลังวัดความระมัดระวังของมัน ไม่ใช่ความทนทานของเป้าหมาย ทำไม pipeline ด้านความปลอดภัยจึงต้องการ endpoint ที่ไม่มีการกรอง
-
API ที่เข้ากันได้กับ OpenAI แบบ Drop-In — ย้ายมาได้ในสองบรรทัด
ชี้ OpenAI SDK ที่คุณใช้อยู่มาที่ unbleep ด้วยการเปลี่ยน base_url กับ key เท่านั้น — streaming, ระดับโมเดล, reasoning_content และข้อควรระวังที่กัดจริง