关于无审查推理的笔记——红队测试、拒答基准,以及在生产环境中运行这套 API。
Abliteration 在模型的残差流中定位拒答方向,并将其从权重中投影掉——无需重新训练,也不靠提示词技巧。
当你的攻击者模型拒答时,你测量的是它的谨慎程度,而不是目标的鲁棒性。为什么安全流水线需要一个无过滤的端点。
只需改掉 base_url 和密钥,就能把现有的 OpenAI SDK 指向 unbleep。流式输出、模型档位、reasoning_content,以及真正会让你栽跟头的几个坑。