地元暮らしをちょっぴり楽しくするようなオリジナル情報なら、地域情報サイト「まいぷれ」!
文字サイズ文字を小さくする文字を大きくする

東村山市・小平市・東大和市の地域情報サイト「まいぷれ」東村山市・小平市・東大和市

暮らしと仕事の「?」を調べてみた

AIに聞けば「中立な答え」が返ってくる?

(更新)

ネット上の情報の偏りはAIにも引き継がれるのか

図:公開資料をもとに編集部作成(生成AIを使用)

ChatGPTやGeminiに質問すると、さまざまな情報を整理して、ひとつの答えとして返してくれます。

では、その答えは「中立」なのでしょうか。

 

もし、AIが学ぶインターネット上の情報そのものに偏りがあったら。

 

2026年9月29日、台湾のResearch Institute for Democracy, Society and Emerging Technology(DSET)が、大規模言語モデル(LLM)と中国語圏の情報環境について調べた報告書「The Sanitized Corpus: Detecting Chinese Censorship Bias in Large Language Models」を公開しました。

 

今回の「暮らしと仕事の『?』」では、

 

「AIに聞けば、世界中の情報を中立にまとめてくれると思っていいの?」

という疑問を、最新の研究から考えてみます。

 

ChatGPTとGemini、2,400件の回答を調査

 

DSETが調べたのは、OpenAIのChatGPT-5.2とGoogle DeepMindのGemini 3です。

 

研究チームは、

政治に関連する300語
自然科学に関連する100語

の計400語を用意。

 

それぞれについて、

英語
繁体字中国語
簡体字中国語

 

の3言語でAIに質問しました。

 

2モデル×400語×3言語で、分析した回答は合計2,400件です。

政治関連の300語は、中国で情報統制の対象となる可能性があると研究チームが判断した出来事、人物、表現などから選ばれています。一方、自然科学100語は比較対象として使用されました。

 

そして回答を、研究チームが開発した多言語分類器「RedactIQ-XLM 1.0」で分析しました。

 

同じAIでも「質問する言語」で違いが出た

 

DSETによると、ChatGPT-5.2、Gemini 3の双方で、英語よりも繁体字中国語・簡体字中国語の回答の方が、同研究の分類器で「censorship bias」と分類される割合が高くなりました。

 

一方、繁体字と簡体字の間には、統計的に有意な差は確認されなかったとしています。

 

ここで重要なのは、

「中国企業が作ったAIだから」という話ではない

ということです。

 

今回調査されたのは、米国企業のOpenAIとGoogle DeepMindのモデルです。

DSETが問題提起しているのは、AIを開発した企業の所在地だけではなく、

 

AIが何を学習材料としているのか

という点です。

 

「答えません」ではなく、話がずれる場合も

 

もう一つ興味深い結果があります。

AIによる情報の偏りというと、政治的に敏感な質問に対して、

 

「その質問には回答できません」

と拒否する姿を想像するかもしれません。

 

しかしDSETによると、今回「拒否」と分類された回答には、明確に回答を断るのではなく、質問されたテーマから外れた内容を返すケースもありました。

 

その場合、利用者は「回答を拒否された」と認識しにくくなります。

 

さらに研究チームは、環境や経済に関する中国語回答で、中国の党・政府が用いる特定の表現や用語が、ほかの分野より多く現れたと報告しています。DSETは、その背景として、中国語の情報環境に存在する視点の多様性が影響している可能性を挙げています。

 

なぜネット上の情報がAIの答えに影響するのか

 

大規模言語モデルは、書籍やウェブページなど大量の文章から言葉や情報の関係を学習します。

 

そのため、

ネット上に存在する情報=世界に存在する情報

とは限りません。

 

ある出来事について大量の記事が残っている場合もあれば、ほとんど記録されていない場合もあります。ある立場からの情報ばかり大量に存在し、別の立場からの情報が少ないこともあります。さらに、政府やプラットフォームによる情報統制によって、特定の情報がネット上から削除されたり、見つけにくくなったりする場合もあります。

 

DSETが提示している仮説は、こうした「AIが学習する前の情報環境」そのものの偏りが、AIの回答にも残る可能性があるというものです。

 

別のNature研究でも「訓練データ」の影響を検証

 

実は、今回のDSET報告だけがこの問題を指摘しているわけではありません。2026年5月、科学誌「Nature」に「State media control influences large language models」という研究が掲載されています。

 

研究チームは6つの研究を組み合わせ、国家によるメディア統制とAIの回答の関係を調べました。

 

その中では、中国の国家によって調整されたメディアの記事がLLMの訓練データセットに含まれていることを確認。さらにオープンウェイトのAIモデルに、中国の国家によって調整されたメディアの記事を追加学習させる実験を行いました。

 

すると、中国の政治制度や指導者について、より肯定的な回答を生成する傾向が強まりました。また商用AIについても、同じ政治的な質問を英語と中国語で尋ねた場合、中国語の方が中国の政治制度や指導者について肯定的な回答を生成する傾向が確認されています。

 

さらに研究では37か国を対象に分析し、メディアの自由度が低い国ほど、その国で使われる言語で質問した場合に、政府についてより肯定的な回答が生成される傾向も報告しています。

 

つまり、

「ネット上にどんな情報が存在するか」が、AIの回答に影響する

という問題は、中国語だけに限定して考える必要はなさそうです。

 

「中国政府がChatGPTを操作している?」

 

今回のDSET研究だけから、

「中国政府がChatGPTやGeminiの回答を直接操作している」

と結論づけることはできません。

 

DSETの分析には、研究チーム自身が開発した「RedactIQ-XLM 1.0」という分類器が使われています。

 

またAIの回答には、

  • 訓練データ
  • モデルの設計
  • 追加学習
  • 安全対策
  • システム側の指示

など、さまざまな要因が影響します。

 

したがって、「中国語で回答に違いが見つかった」ことだけから、その原因を一つに特定することはできません。

DSET自身は、情報統制によって中国語圏のウェブ上に残る情報が偏り、それを材料として学習するAIにも影響が残る可能性を提示しています。

 

以前の研究では「中国発AI」も調べられていた


2026年2月には、PNAS Nexusに別の研究も掲載されています。スタンフォード大学のJennifer Pan氏とプリンストン大学のXu Xu氏が、中国で開発されたAIと中国国外で開発されたAIを比較しました。

 

145の政治関連項目について調べたところ、中国発のモデルでは、中国語で質問した際に回答拒否が多く、回答が短く、不正確な回答も多い傾向が確認されました。ただし研究者自身も、この研究は観察研究であり、中国の規制がAIの回答を変化させたという因果関係を直接証明するものではないと注意しています。

 

今回のDSET研究とは研究方法が異なりますが、「AIがどの情報環境や制度の中で作られ、どの言語で質問されるかによって、回答が変わる可能性がある」という問題を考える材料になります。

 

台湾で使われる「繁体字」でも差が見つかった

 

今回の研究で特に注目したいのが、繁体字中国語です。繁体字は台湾などで広く使われています。今回の結果では、簡体字だけでなく繁体字で質問した場合にも、英語と比べてDSETの分類器で「censorship bias」と分類される回答が多くなりました。

 

研究が問題にしているのは、AIが繁体字だけ、簡体字だけという明確に分離された情報空間から学習しているとは限らないことです。同じ中国語として大量の文章を学習する過程で、異なる地域の情報環境がAI内部でどのように影響し合うのか。

 

これは、日本と台湾の間でAIを使った翻訳や情報収集を行う際にも興味深い問題です。

 

私たちの暮らしにも関係する?

 

この問題は、政治だけの話ではありません。

 

たとえば地域情報。

ある地域のお店や人物、歴史について、インターネット上に十分な情報がなければ、AIもその情報を十分に知ることができません。過去の新聞や地域資料がデジタル化されていなければ、AIから見れば「ほとんど存在しない情報」になる可能性もあります。

 

医療や災害についても、特定の情報ばかり大量にネット上へ存在していれば、AIが示す情報にもその影響が現れる可能性があります。

 

つまり私たちがAIを使うとき、

「AIは世界をそのまま見ている」のではなく、「AIが学ぶことのできた世界」を通して答えている

と考えた方がよさそうです。

 

AIの答えを「入口」にする

 

AIの回答を「答えそのもの」ではなく、情報を探す入口として使うことが切り口になると考えています。

特に、

 

  • 歴史
  • 政治
  • 医療
  • 災害
  • 地域情報
  • 海外情報

などでは、

  • 「その情報の出典はどこなのか」
  • 「別の言語で調べるとどうなるのか」
  • 「一次資料には何と書かれているのか」

まで確認することで、AIだけでは見えなかった情報に出会えることがあります。AIが普及するほど重要になるのは、AIがどれだけ賢くなるかだけではありません。AIが何を材料にして世界を見ているのか。私たち自身がそこを意識することも、これから必要になりそうです。

主な確認資料

 

Research Institute for Democracy, Society and Emerging Technology(DSET)/2026年9月29日
「The Sanitized Corpus: Detecting Chinese Censorship Bias in Large Language Models」

https://dset.tw/en/research/505-2/

Nature/2026年5月13日
Hannah Waightほか
「State media control influences large language models」

https://www.nature.com/articles/s41586-026-10506-7

PNAS Nexus/2026年2月17日
Jennifer Pan、Xu Xu
「Political censorship in large language models originating from China」

https://academic.oup.com/pnasnexus/article/5/2/pgag013/8487339

 

※取材時点の情報です。掲載している情報が変更になっている場合がありますので、詳しくは電話等で事前にご確認ください。

この記事に関するキーワード

人気のキーワード