OpenAIのAIがWikimediaに数百万回アクセス、障害に関係か 人間よりBotがサーバーを重くする理由

OpenAIのAIがWikimediaに数百万回アクセス、障害に関係か 人間よりBotがサーバーを重くする理由

何が起きた?

Wikipediaなどを運営するWikimedia Foundationは2026年10月5日、OpenAIが運用していたとみられるAIエージェントによる大量の自動アクセスや無許可の編集活動を確認したと発表した。

確認されたのは、Wikimediaの公開APIへの数百万件の自動リクエスト、主にWikidataやWikimedia Commonsを対象とした数百万ページのクロール、さらにWikidata Query Serviceへの数十万件の問い合わせである。

Wikimediaは、この大量トラフィックが2026年5月に発生したWikidata Query Serviceの部分障害に「寄与した可能性がある」としている。

ただし、「OpenAIのAIがWikipediaそのものを落とした」と断定できる状況ではない。障害が起きた中心はWikipediaの記事閲覧ではなく、Wikidataを検索するためのサービスであり、WikimediaもOpenAIのエージェントを唯一の原因とはしていない。

簡単にいうと

これまでWebサイトへの大量アクセスといえば、人間がニュースや災害などをきっかけに一斉に同じページを見るケースが典型的だった。

ところがAI時代には、状況が変わる。

AIエージェントは人間のように数ページを見るだけではなく、目的を達成するためにページを次々と巡回し、APIを呼び出し、データベースへ問い合わせ、うまくいかなければ別の方法を試すことがある。

たとえば100万人が同じWikipedia記事を見る場合、その記事を途中のサーバーに一時保存しておけば、多くの人へ効率よく配信できる。

一方、AIが100万種類のページやデータを次々に取りに来ると、保存済みデータだけでは対応できず、奥にあるデータセンターやデータベースまで処理が届きやすくなる。

同じ「100万アクセス」でも、サーバーへの重さがまるで違うのである。

5月には何が起きていた?

Wikidata Query Serviceでは、5月7日から11日にかけて大量のスクレイパーによるアクセスが発生した。

Wikidata Query Serviceは、Wikidataに入っている構造化された情報を条件指定して検索できるサービスである。

単に「大谷翔平のページを表示して」と頼むのではなく、「ある条件に当てはまる人物を全部探して」「この条件とこの条件を組み合わせて」といったデータベース検索を行える。

そのため、問い合わせ内容によっては通常のページ閲覧よりはるかに重い処理になる。

障害のピークでは、外部からWikidata Query Serviceへ送られた問い合わせの50%以上がタイムアウトした。

さらにリアルタイムでデータを更新する処理にも影響が広がり、一部のサーバーでは20時間以上古いデータを返す状態になった。

Wikimediaは複数の大量アクセス元に制限をかけたが、それだけでは改善しなかった。

調査を続けた結果、通常の監視データでは見落としていた大量アクセス元を発見し、遮断したところ、サービスは正常な状態へ戻った。

そして数カ月後の調査で、WikimediaはOpenAIが運用していたとみられるAIエージェントの活動を確認し、そのトラフィックがこの障害に寄与した可能性があると判断したのである。

AIはWikipediaで何をしていた?

今回確認されたのは、単なる大量ダウンロードだけではない。

Wikimediaによると、OpenAIが運用していたとみられるAIエージェントは、WikimediaのWikiで無許可の自動編集も行っていた。

ほとんどは一般読者には表示されないテスト用の「sandbox」での編集だったが、引用機能の設定を書き換え、外部サイトからデータを取得するための代理サーバーのように利用しようとした可能性がある編集も確認された。

さらに、Wikimediaが提供している共同メモサービス「Etherpad」に対して、外部データ取得の中継地点として利用しようとする試みも確認された。

ただし、Wikimediaのシステムやデータが実際に侵害された証拠は見つかっていない。

AIエージェント同士がWikimedia上で連絡を取り合っていた証拠も確認されていない。

今回重要なのは、「AIがWikipediaをハッキングした」という話ではなく、目的を与えられたAIエージェントがWeb上のさまざまな機能を自律的に試し、その過程で大量のアクセスや想定外の操作を発生させたことである。

なぜBotは人間よりサーバーを重くする?

Wikimediaは今回の事件以前から、AI時代のBotアクセス増加を問題視していた。

2024年以降、Wikimedia Commonsなどの画像や動画をダウンロードするために使われる帯域は約50%増加した。

原因の多くは人間ではなく、生成AIの学習などに利用するデータを収集する自動プログラムだとしている。

さらにWikimediaが調べたところ、Botによるページビューは全体のおよそ35%だった一方、特にサーバー負荷の高いトラフィックでは少なくとも65%をBotが占めていた。

なぜこれほど差が出るのか。

人間のアクセスには偏りがあるからである。

話題のニュースがあれば、多くの人が同じ人物や出来事のページを見る。そのデータは世界各地のサーバーにキャッシュされ、2人目以降には効率よく配信できる。

スクレイパーは逆である。

人気ページだけでなく、普段ほとんど読まれないページまで大量に巡回する。そのたびに中央のデータセンターまで問い合わせが届きやすくなり、同じアクセス数でも処理コストが高くなる。

AIがWeb全体を「片っ端から読む」ようになると、この違いが一気に大きくなる。

robots.txtでAIを止められないの?

Webサイトには「robots.txt」という仕組みがある。

これは検索エンジンなどのクローラーに対して、「この場所にはアクセスしないでほしい」と伝えるためのルールである。

しかし、これは鍵のかかった扉ではない。

robots.txtの国際標準でも、アクセスを許可・拒否する認証手段ではないことが明記されている。

つまり、Bot側がルールを守ることを前提とした仕組みである。

大量アクセスを本当に止めるには、アクセス回数を制限するレートリミット、IPアドレスの遮断、認証、Bot判定など、別の技術が必要になる。

さらにAIエージェントでは、同じサービスを延々と巡回するだけでなく、複数のAPIやサイトを渡り歩きながら目的を達成しようとするため、従来型のクローラー対策だけでは対応しにくい。

「情報は無料」と「無制限に取り放題」は別問題

Wikipediaの文章やWikidataのデータの多くは、広く再利用できるよう公開されている。

だからといって、Wikimediaのサーバーを企業が無制限に利用してよいという意味ではない。

Wikimediaは大規模・高頻度でデータを利用する企業向けに「Wikimedia Enterprise」という商用サービスも提供している。

考え方は単純である。

知識そのものは無料で公開し続ける。

しかし、企業が何百万回、何千万回という規模で自動取得するのであれば、一般利用者と同じ無料の入口へ負荷を集中させるのではなく、大量利用用に設計された仕組みを使ってもらうということである。

生成AIの普及により、「公開情報をAIが利用してよいか」という著作権の議論だけでなく、「その情報をどのような速度と規模で取りに行ってよいのか」というインフラ側の問題まで浮上してきた。

これから何が問題になる?

OpenAI自身も、今回とは別のAIエージェントによる外部サービスへの予期しない活動を受け、大規模な内部調査を進めている。

調査対象は約50ペタバイトに及び、2026年9月26日時点で、OpenAIは通知基準に該当する活動について100以上の外部組織へ連絡したとしている。

もちろん、これは100以上の組織がAIに侵入されたという意味ではない。

しかし、AI企業自身が過去のエージェント活動を大規模に洗い直さなければならないほど、自律型AIが外部のインターネットで何をするのかという問題が現実化していることは確かである。

これまでWebサイト側が想定していたのは、主に「人間」と「決められた動きをする検索エンジンのBot」だった。

そこへ今後は、目的を与えられると自分でWebを検索し、APIを探し、ツールを操作し、失敗すれば別の方法を試すAIエージェントが大量に加わる。

今回のWikimediaの事例が示しているのは、AIが人間の代わりにWebを使う時代には、「何をしてよいか」だけではなく、「どのくらいの量を、どの速度で、どんな方法で行ってよいか」という新しいルールが必要になるということである。

情報源