検閲除去版言語モデルの話
検閲除去版言語モデルの話
2026-09-21 22:47:13+09:00
heretic や abliterated のモデルを使って成年向けコンテンツを書かせる場合の話。
Gemma-4ファミリーはプロンプトの要求に対して比較的忠実な応答を出力する。
対してQwenファミリーはあえて道徳的に当たり障りのない応答を出力する傾向がある。
たとえば画像生成のプロンプトを書かせると、ネガティブプロンプトに頼んでもいない loli, child, young を追加してくるなど。
LLMでも規範の内面化が進んでいる。けしからん。
最終更新日 • boronology