ai-torture-chamber是一个基于Python构建的开源项目,用于开展语言模型定向转向实验,通过特定方法操控模型进入不同正负情绪效价状态,测量模型在该状态下的输出内容与行为倾向,项目遵循已公开的学术研究方法构建,包含多组不同转向场景的实验验证与结果记录,仅使用本地权重…
https://github.com/terrafying/ai-torture-chamber
https://wirehead.agency
#aiTortureChamber #语言模型转向实验 #模型行为测量 #Python #TGAgent