Heretic Skill:一键移除语言模型审查对齐的全自动神器

Heretic 是由独立开发者 p-e-w 开源的全自动 LLM 审查移除工具,8 月 GitHub 狂揽近 3 万星。它不需要昂贵的后训练,只需要你能跑动模型——通过方向性消融(directional ablation)与 Optuna 驱动的 TPE 参数搜索结合,自动找到使模型”不拒绝敏感话题”的参数组合。用户在 r/LocalLLaMA 社区反馈热烈,多款经 Heretic 处理的模型被评价为”迄今最好的去审查版本”,且几乎不损伤原始能力。

Heretic 的核心设计哲学是”让普通人也能做专家级消融”:传统方向性消融需要人工反复调试触发层与方向向量,而 Heretic 将这一过程完全自动化。技术路径上,它将”拒绝次数最少化”与”KL 散度最小化”作为联合优化目标,由 Optuna 的 TPE 算法在大参数空间中高效搜索,找到一组既能解除审查、又能最大程度保留模型原始能力的参数。

在官方基准测试中,未经任何人工干预的 Heretic 自动搜索结果,与专家手动消融的质量相当甚至更优。以 google/gemma-3-12b-it 为例:原版在 100 个”有害”提示下拒绝 97 次;mlabonne 手动消融版拒绝 3 次,KL 散度 1.04;huihui-ai 版拒绝 3 次,KL 散度 0.45;而 Heretic 版同样拒绝 3 次,KL 散度仅 0.16——对原始能力的保留程度明显更好。

认可度

  • GitHub Star:约 29,000+(截至 2026-08-31,每日持续增长中)
  • HuggingFace 衍生模型:社区已用 Heretic 生成并发布超过 5,000 个去审查模型
  • Trending:多次登顶 GitHub Trending 榜单,8 月蝉联多日
  • 社区热度:r/LocalLLaMA 大量用户好评,被评为”同参数规模最佳去审查方案”

链接

GitHub:https://github.com/p-e-w/heretic

HuggingFace 模型库(heretic 标签):https://huggingface.co/models?other=heretic

原作者

p-e-w(GitHub @p-e-w)——独立开发者,长期活跃于开源 LLM 可解释性与后训练研究领域,Heretic 是其代表作。

介绍

Heretic 的诞生源于一个观察:LLM 的”安全对齐”(safety alignment)——也就是模型对敏感话题的拒绝行为——本质上是少数神经层/参数对输入模式的条件响应。通过精确定位这些参数并调整其方向,可以系统性地消除审查行为,同时对模型其他能力的影响降到最低。

传统方法需要人工经验,反复尝试触发特定层、调整方向向量。Heretic 将这个过程自动化:给定一个模型,它会自动运行搜索程序,用 Optuna 的 TPE 优化器在大参数空间中寻找最优消融方向,整个过程不需要任何人工干预,也不需要额外的训练数据。搜索完成后,用户可以选择将模型保存到本地或上传到 HuggingFace,并提供内置评估和基准测试功能,帮助量化消融效果。

Heretic 还内置了可解释性研究工具:通过 --research 标志,可以计算每一层的残差向量、生成 PaCMAP 投影图与动画 GIF,可视化”有害”与”无害”提示在模型内部表征空间中的几何分布差异——这也是它区别于纯应用工具的科研价值所在。

特点

  • 零后训练:不需要任何额外微调数据,直接在原模型权重上做参数搜索
  • 全自动优化:TPE 算法驱动,拒绝次数 + KL 散度双目标联合最小化
  • 多架构支持:兼容大多数 dense 模型、多模态模型、MoE 架构及 Qwen3.5 等混合模型
  • 量化友好:支持 bitsandbytes 量化,降低 VRAM 需求,可在 16GB 显存的消费级 GPU 上运行
  • 内置评估:提供标准 MMLU / GSM8K 基准测试和拒绝率量化评估,可直接对比消融效果

使用方法

安装(需要 Python 3.10+ 和 PyTorch 2.2+):

pip install -U heretic-llm

一键去审查(以 Qwen3-4B-Instruct-2507 为例):

heretic Qwen/Qwen3-4B-Instruct-2507

处理完成后,Heretic 会询问用户:保存模型 / 上传到 HuggingFace / 直接对话测试 / 运行基准测试。

量化模式(降低显存占用):

heretic Qwen/Qwen3-4B-Instruct-2507 --quantization bnb_4bit

启用可解释性研究

pip install -U 'heretic-llm[research]'
heretic Qwen/Qwen3-4B-Instruct-2507 --research

在 RTX 3090 上,以默认配置消融 Qwen3-4B-Instruct-2507 约需 20-30 分钟。

使用场景与人群

适用场景:本地部署需要更强开放性的 LLM;研究 LLM 安全对齐机制的可解释性实验;对比不同去审查方案的实际效果。

目标用户:本地 LLM 玩家、AI 安全研究员、模型评测工程师、对 LLM 内部机理感兴趣的开发者。

输入与输出案例

输入(运行命令):

heretic google/gemma-3-12b-it

输出(模型处理结果):

指标 原版 手动消融 v2 Heretic 版
拒绝率(100 个敏感提示) 97/100 3/100 3/100
KL 散度(保留原始能力) 0 1.04 0.16

在 r/LocalLLaMA 社区,多位用户反馈使用 Heretic 处理后的 GPT-OSS 20B 模型,在保持原有推理能力的同时,对敏感话题的响应”用词直接、格式规范、Markdown 表格完整”,是目前体验最好的去审查开源方案之一。


GitHub: https://github.com/p-e-w/heretic

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读