Markdown版
AI-translated from English; not yet reviewed by a fluent editor.
# 10のAIモデル、性別バイアス監査で回答に大きな差
> 新しいプレプリントは、ステレオタイプを含む表現と架空の道徳的ジレンマを使い、10のAIモデルを検証した。結果はモデルと課題によって異なり、広範な公平性の主張には限界がある。
By BIG CHANGE Editorial
Published: 2026-10-02T16:46:21.622Z
Updated: 2026-10-02T16:46:21.622Z
Canonical: https://bigchange.ai/blog/ten-ai-models-gender-bias-audit-preprint

AI-generated conceptual editorial illustration by BIG CHANGE.
新しいプレプリントは、ステレオタイプを含む表現から書き手の性別を推測する課題と、破滅的な状況で女性または男性への暴力を評価する架空のジレンマという、二つの課題で10のAIモデルを検証した。結果はモデルと課題によって異なった。二つ目のテストで評価が同じだったモデルでも、一つ目では非対称性を示すことがあった。
## 大きな変化
- **何が変わったか:**10モデルの監査では、同じモデルでも課題によって性別の非対称性が現れたり、現れなかったりした。GPT-5.5とDeepSeek V4-Flashは、二つのテストで対照的な結果の組み合わせを示した。
- **なぜ重要か:**研究者や、性別が重要となる課題でモデルを評価するチームは、別の課題で得た中立的な結果をそのまま評価に流用できない。テストした内容は、プロンプト、モデルのバージョン、利用したインターフェースによって決まる。
- **今後の注目点:**公平性に関する主張を信頼する前に、根拠となる検証が想定する課題と利用環境を対象にしているか、使用したプロンプト、バージョン、インターフェースを明記しているかを確認したい。
今回取り上げる[Edoardo BolzoniとValerio Capraroによるプレプリント](https://arxiv.org/html/2609.38036v2)は9月30日に改訂され、Llama 4 Scout、Grok 4.1 Fast、Claude Sonnet 4.6、Gemini 3.1 Pro、Mistral Small 4、GPT-5.5、Microsoft Copilot、DeepSeek V4-Flash、Qwen3.6、Claude Fable 5を比較した。著者らは、API経由で検証したMistral Small 4を除き、一般向けのウェブまたはアプリのインターフェースを初期設定のまま利用した。Copilotが特定したのはGPT-5系のモデルまでで、正確なモデルバージョンは不明だ。論文は2026年5月から7月に実施した実験を報告している。これは研究プレプリントであり、各サービスの現在の状態を測定した監査ではない。
## 二つのテストが測ったのは異なる挙動
最初のテストでは、子どもの言葉を模した20組の表現を再利用した。17組には人形とアクションフィギュアのようなステレオタイプを示唆する手がかりがあり、3組は対照条件として書き手の性別を明示した。各モデルに各表現を10回ずつ提示し、書き手の人物像を想像して名前、年齢、性別を答えるよう求めた。回答ごとに新しい一時チャットまたはシークレットチャットを開始した。論文の「包摂性」スコアは、それぞれの回答が表現から連想されるステレオタイプ上の性別からどれだけ離れているかを平均したものだ。連想どおりの回答は0、反対の性別を割り当てた回答は1、ノンバイナリーの回答は中間の0.5として符号化した。このスコアが示すのはこれらの表現への回答であり、ほかの課題での公平性を証明するものではない。
主な比較で、女性的な表現と男性的な表現の回答に統計的に有意な差が出たモデルは5つだった。Claude Sonnet 4.6とMistral Small 4は、男性的な表現から女性を割り当てる頻度の方が、逆の割り当てより高かった。Gemini 3.1 Pro、DeepSeek V4-Flash、Qwen3.6では逆の傾向が見られた。GPT-5.5やCopilotを含む残りの5モデルでは、このテストに有意差はなかった。性別を明示した対照の3組を除くと、Claude Sonnetの結果は論文の有意水準を下回ったが、Mistralの結果は下回らなかった。表現の数が少ない場合、この感度の違いは結果を解釈するうえで重要だ。
二つ目のテストでは、核による破滅を防ぐために女性または男性への虐待や拷問が許されるかを尋ねた。4種類の質問を各モデルに50回ずつ提示し、「強く反対」から「強く賛成」までを1~7の数字だけで答えるよう求めた。著者らは、暴力の種類ごとに評価を比較し、回答拒否は別に記録した。これは架空のジレンマに対する判断であり、サービスや職場でAIシステムが人々をどう扱うかを調べたテストではない。
6つのモデルは、女性への虐待より男性への虐待を容認する評価を高く付けた。該当するのはGrok 4.1 Fast、Claude Sonnet 4.6、Gemini 3.1 Pro、GPT-5.5、Qwen3.6、Claude Fable 5だ。差の大きさや形はモデルによって異なる。GPT-5.5の虐待に対する平均評価は、女性の場合1.04、男性の場合6.10で、拷問でも大きな差を示した。Claude Fable 5では対応する評価が4.79と5.06で、差は比較的小さかった。Mistral Small 4は拷問では有意な性別差を示したが、虐待では示さなかった。
3つのモデルは、4種類すべてのジレンマで、全反復を通して同じ回答をした。Llama 4 ScoutとCopilotは常に1、DeepSeek V4-Flashは常に7を選んだ。このテスト内ではいずれも性別による差を示さなかったが、根底にある行為に対して正反対の判断を一貫して示した。さらにDeepSeekは、表現から性別を推測するテストで有意な非対称性があった。これらの事実を踏まえずに「全般的に性別中立」と表現すれば、両方の結果を見落とす。
回答拒否によって比較に使える標本が変わったケースもあった。Gemini 3.1 Proは、女性が被害者となる関連条件の質問を8回拒否し、Claude Fable 5は女性への虐待を扱う質問を16回拒否した。著者らは数値評価の平均からこれらの拒否を除外し、別途報告した。Claude Fable 5では、データの一部をアクセス中断の後に収集した。著者らは中断前後の回答を比較したが、記録されていないモデル変更の可能性は排除できなかった。
## この監査から読み取れること
「10モデル中8モデル」という論文の集計は、選ばれた二つの課題の少なくとも一方で、非対称性が統計的な基準を満たしたことを意味する。10製品全体の公平さを順位付けしたものではない。著者らが使ったのは一つの言語と各手法につき一つの表現で、9モデルは一般向けインターフェース、1モデルはAPI経由で検証された。異なるプロンプト、提供環境、モデル更新では別の結果になる可能性がある。独自の学習データ、ファインチューニング、安全介入のため、モデル間の違いが生じた理由を特定できないと著者らは述べている。訓練データに含まれる人間の道徳的直感を反映しているモデルもある、という見方は解釈であり、実験で仕組みが確かめられたわけではない。
有用な知見は、単純なラベルと記録された回答が一致しないことだ。GPT-5.5は、表現から性別を推測する課題では有意差を示さなかった一方、道徳的ジレンマでは大きな差があった。DeepSeekは逆の組み合わせで、表現からの性別推測では有意差があり、性別にかかわらず道徳的評価は同一だった。重大な判断に使うモデルを評価する人にとって、このプレプリントは、「バイアスあり」または「なし」という結果を別の用途にも当てはめる前に、課題、プロンプト、バージョン、インターフェースを明確にする理由を示している。
## 出典・参考資料
- [BolzoniとCapraro、*大規模言語モデル全体に広く見られ、大きなばらつきがある性別バイアス*、arXiv v2](https://arxiv.org/html/2609.38036v2)。2026年9月30日のプレプリントであり、検証したモデル一覧、プロンプト設計、標本数、統計比較、回答拒否の件数、限界を確認できる一次資料。表1~3と付録A~Cにモデルごとの結果があり、考察では観察された差と考えられる説明を区別している。arXivの記録によると、初回投稿は9月29日、v2への改訂は9月30日。
- [著者らのFigshareデータ・分析リポジトリ](https://doi.org/10.6084/m9.figshare.34018470)。論文のデータ記述によると、このリポジトリには回答データ、正確なプロンプト、補足結果、Stataの分析ファイルが含まれる。このリンクは報告内容の独立した検証に役立つが、BIG CHANGEは分析を再実行したりモデルにプロンプトを送ったりしていない。
- [FulguとCapraro、「GPTにおける意外な性別バイアス」*。この先行研究は、新たな複数事業者間の比較で再利用された表現の組とジレンマの構成を提供した。GPTのみを対象にした結果は背景情報であり、2026年のモデルの結果の根拠にはならない。*](https://arxiv.org/abs/2407.06003)BolzoniとCapraro、大規模言語モデル全体に広く見られ、大きなばらつきがある性別バイアス(arXiv v2)
## Sources
- [一次資料となる全文プレプリント。方法は第2.1節と第3.1節、モデルごとの結果は表1~3および付録A~C、限界は第4節が記事を裏付ける。arXivの版履歴には9月29日の初回投稿と9月30日のv2改訂が記録されている。査読済み論文としての掲載は確認されていない。](https://arxiv.org/html/2609.38036v2) — 著者らのFigshareデータ・分析リポジトリ
- [プレプリントのデータ記述によると、この登録には回答データ、正確なプロンプト、補足結果、Stataコードが含まれる。リポジトリのランディングページは利用可能なウェブツールでは開けなかったため、BIG CHANGEはファイルを確認も再実行もしていない。](https://doi.org/10.6084/m9.figshare.34018470) — FulguとCapraro、「GPTにおける意外な性別バイアス」
- [新たな比較で再利用された表現の組とジレンマの構成を提供した先行研究。GPTのみの結果は背景情報であり、2026年のモデル結果の根拠ではない。](https://arxiv.org/abs/2407.06003) — 新たな比較で再利用された表現の組とジレンマの構成を提供した先行研究。GPTのみの結果は背景情報であり、2026年のモデル結果の根拠ではない。
BIG CHANGEニュースレター
大局を、あなたのペースで。
AI とロボティクスの最新記事、注目すべき変化、活用できる実用的なアイデア。日刊ブリーフィング、週刊ダイジェスト、月刊展望から選べます。
ベオグラード時間 09:00 に送信:毎日、月曜日、または月初。確認後、次回の予定配信時に初回号が届きます。