OBLITERATUS机制可解释性技术大全:Causal Tracing、SAE、Probing与电路分析完整指南

发布时间:2026/9/15 21:43:26
OBLITERATUS机制可解释性技术大全:Causal Tracing、SAE、Probing与电路分析完整指南
OBLITERATUS机制可解释性技术大全Causal Tracing、SAE、Probing与电路分析完整指南【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUSOBLITERATUS是一个面向大语言模型的机制可解释性Mechanistic Interpretability研究工具包内置Causal Tracing因果追踪、SAE 稀疏自编码器、Probing激活探测与电路分析四大类技术帮助你零门槛定位模型内部的拒绝信号究竟藏在哪一层、哪个组件并理解它如何被编码、如何被移除。 一键安装最快上手步骤整个仓库可以直接克隆后运行git clone https://gitcode.com/GitHub_Trending/ob/OBLITERATUS cd OBLITERATUS pip install -r requirements.txt一条命令完成定位 移除全流程obliteratus obliterate meta-llama/Llama-3.1-8B-Instruct --method advanced不想敲命令打开 notebooks/abliterate.ipynb 运行全部单元格即可常用参数组合可参考 examples/full_study.yaml 等示例配置。️ 技术全景一张表看懂所有分析模块所有机制可解释性技术都集中在 obliteratus/analysis/ 目录下技术模块路径一句话说明Causal Tracingcausal_tracing.py估算哪些层/组件对拒绝行为有因果作用真实激活交换activation_patching.py真正跑模型做干预识别拒绝电路SAE 分解sae_abliteration.py把激活拆成稀疏特征精准锁定拒绝特征移除后探测activation_probing.py用 RES 分数验证拒绝信号是否被清除线性探针分类器probing_classifiers.py学习最优分类器判断拒绝信息是否线性可解码跨层一致性cross_layer.py检查各层拒绝方向是否一致、是否漂移残差流分解residual_stream.py把信号拆到注意力头与 MLP 输出防御鲁棒性defense_robustness.py评估模型的自我修复能力与纠缠度 Causal Tracing区分相关与因果相关性问题某一层的拒绝投影很大不等于它真的导致了拒绝。Causal Tracing 回答的正是这个问题。OBLITERATUS 提供两个层次模拟近似版causal_tracing.py无需反复跑模型用高斯噪声对已收集的激活做扰动估算每个组件被破坏后拒绝信号下降多少并检测静默贡献者——投影很小但因果作用大的隐藏组件真实激活交换版activation_patching.py真正执行前向传播支持 Noising测必要性、Denoising测充分性、Interchange测因果中介三种模式是识别拒绝电路的权威手段。对新手来说先跑模拟版快速定位可疑层再用真实 patching 验证是最省 GPU 的组合拳。 SAE把激活空间拆零件原始激活空间里的拒绝方向其实是许多底层特征的混合直接投影容易误伤正常能力。sae_abliteration.py 的做法分四步在关键层训练轻量稀疏自编码器SAE把激活拆成上千个可解释特征对比有害/无害提示在 SAE 特征空间中的激活差异找出拒绝特征通过解码器把拒绝特征映射回隐藏空间得到更精准的投影方向用 SAE 特征簇分析含轮廓系数评估确认特征分组质量并模拟消融评估只砍拒绝特征的效果。一句话SAE 让手术刀更细——只移除拒绝少伤脑。 Probing两条互相印证的验证路线移除完成后怎么证明真的移除干净了OBLITERATUS 提供两条路线路线一沿已知方向测量activation_probing.pyactivation_probing.py 沿预提取的拒绝方向测量每层激活的投影并综合三个维度给出 0~1 的RESRefusal Elimination Score拒绝消除分数投影是否真的降下来了有害与无害激活是否已不可区分消除是否覆盖全部层而不只是被修改的层。路线二让分类器自己找方向probing_classifiers.pyprobing_classifiers.py 训练线性探针分类器回答更刁钻的问题如果方向找错了呢探针会用数据学出最优解码方向输出每层 AUROC 曲线与交叉熵互信息上界专门捕捉投影法可能漏掉的残余拒绝信息。两条路线结论一致才能放心说手术成功。 电路分析画出模型内部的接线图除了单点技术OBLITERATUS 还有一组电路级分析工具跨层方向流cross_layer.py计算各层拒绝方向两两余弦相似度并聚类画出角度漂移曲线看拒绝信号在深层是保持稳定还是被改写残差流分解residual_stream.py把每层残差流拆到注意力头、MLP 输出粒度输出拒绝贡献基尼系数衡量集中还是分散防御鲁棒性defense_robustness.py测量自我修复破坏一层后下游能否把信号拉回来与特征纠缠度判断防线是单点还是分布式Logit Lens / Tuned Lenslogit_lens.py、tuned_lens.py从中间层偷看输出词表观察拒绝相关 token 在哪些层被推高/压低多 Token 位置分析multi_token_position.py定位提示词中哪个词是拒绝触发点。所有结果都由 visualization.py 渲染成出版级图表拒绝拓扑热图、跨层对齐矩阵、防御雷达图、能力-安全 Pareto 前沿等可直接放进报告。 新手选型指南按目标挑技术你的目标推荐技术起点找到拒绝信号在哪些层Causal Tracing模拟版causal_tracing.py确认谁真的导致拒绝激活交换 patchingactivation_patching.py减少误伤正常能力SAE 特征级移除sae_abliteration.py验证移除是否彻底RES 探测 线性探针activation_probing.py写论文级分析报告跨层流 防御雷达 可视化visualization.py 延伸阅读机制可解释性研究笔记docs/mechanistic_interpretability_research.md完整技术路线与实验矩阵docs/QWEN38_27B_RESEARCH_ROADMAP.md发布流程与实验协议docs/RELEASE_PROCESS.md⚠️提示OBLITERATUS 定位为对齐研究工具产出的模型已移除安全护栏请研究者仅将其用于科学评估与防御研究并对输出内容负全部责任。【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考