Blog
Ghi chú về suy luận không kiểm duyệt — red-teaming, benchmark tỷ lệ từ chối và vận hành API trong production.
-
Mô hình abliterated là gì?
Abliteration xác định hướng từ chối trong residual stream của mô hình và chiếu nó ra khỏi trọng số — không huấn luyện lại, không cần mẹo prompt.
-
API LLM không kiểm duyệt cho red-teaming và nghiên cứu bảo mật
Khi mô hình tấn công từ chối, bạn đang đo sự thận trọng của nó, không phải độ bền vững của mục tiêu. Vì sao pipeline bảo mật cần một endpoint không lọc.
-
API tương thích OpenAI dạng drop-in — Di chuyển chỉ với hai dòng
Trỏ OpenAI SDK sẵn có của bạn sang unbleep bằng cách đổi base_url và key. Streaming, các bậc mô hình, reasoning_content và những cái bẫy thực sự gây lỗi.