Blog
Notes sur l'inférence sans censure — red-teaming, benchmarks de refus et l'API en production.
-
Qu'est-ce qu'un modèle abliterated ?
L'abliteration localise la direction de refus dans le flux résiduel d'un modèle et la projette hors des poids — sans réentraînement, sans astuce de prompt.
-
Une API LLM sans censure pour le red-teaming et la recherche en sécurité
Quand votre modèle attaquant refuse, vous mesurez sa prudence, pas la robustesse de la cible. Pourquoi un pipeline de sécurité veut un endpoint non filtré.
-
Une API compatible OpenAI en remplacement direct — migration en deux lignes
Pointez votre SDK OpenAI vers unbleep en changeant base_url et la clé. Streaming, paliers de modèles, reasoning_content et les pièges qui mordent vraiment.