コンテンツへスキップ

media AI活用の最前線

【2026年最新】arXiv論文のAI執筆率32%調査|検出限界も解説

【2026年最新】arXiv論文のAI執筆率32%調査|検出限界も解説

結論:2026年7月までの直近1年間で、新規arXiv論文の約32%が「AI執筆らしい」と判定されたが、この数字を鵜呑みにしてはいけない。研究チーム自身が「測定はどこで壊れるか」を4つの限界として明示しており、分野によって判定率は0.7%〜65.0%と大きく異なる。

この記事の要点:

  • 誤検知率0.4%に固定した測定設計で、コンピュータ科学65.0%〜数学0.7%まで分野差が約90倍ある
  • 「AI率が低い」ことは「AIを使っていない」ことの証明にならない。数学分野は検出器の守備範囲外という別の可能性がある
  • 研究チーム自身が「1つのスコアを個人の執筆行為の断定材料にしてはいけない」と明言している

対象読者:AI検出ツールの数字をニュースやSNSで見て、自社の生成AI活用ルールや学生・従業員の文章判定にどう使うべきか迷っている経営者・人事担当者・教育関係者

読了後にできること:自社や学校で「AIチェッカーの数値」を懲戒・評価の証拠として単独で使っていないか、判定フローを1つ点検できるようになります

「AIが書いた論文がXX%ある」という見出しは、SNSでたびたびバズる。だが多くの場合、その数字の裏にある検出ツールが、そもそも人間の文章もどれくらい誤って「AI」と判定してしまうのかが示されていない。

2026年7月、Hacker Newsで197ポイントを集めた記事「How we measured AI writing across arXiv, and where the measurement breaks」は、まさにこの弱点への反論として書かれている。開発元のunslopは、2021年〜2022年の「ChatGPT登場前」の論文を人間執筆の正解データとして扱い、そこでの誤検知率をちょうど0.4%に固定したうえで、2023年1月から2026年7月までのarXiv論文12,750本を実際にスコアリングした。

この記事では、その測定手法と分野別の実測値を正確に紹介したうえで、本題である「測定はどこで壊れるか」——研究チーム自身が挙げる4つの限界を掘り下げる。そして、この限界の構造が、企業や学校がAI検出ツールをどう扱うべきかにそのままつながることを解説する。

何を測定したのか — 12,750本のarXiv論文を分析した調査の全体像

この調査の出発点は「誤検知率をまず固定する」という設計思想にある。研究チームは記事の中でこう説明している。

「N%のXがAIになった」という見出しのジャンルがある。そのほとんどは読む価値がない。なぜなら、その数字を出している検出器は、人間が書いた文章の一定割合も『AI』と判定してしまうからだ。もし新しい論文の40%を機械執筆と判定するツールが、ChatGPT登場前の論文の20%も同様に判定するなら、本当の話は誰も触れていないその20%の方だ。

そこでunslopは、この批判を測定設計そのものに組み込んだ。使用した検出器は学術文章向けに調整されており、誤検知率0.4%の閾値において、ChatGPT登場前の正真正銘の科学論文の99.6%を「人間執筆」として正しく通過させ、AI執筆の学術文章の85%を検出できる。この0.4%という誤検知率を測定全体の「基準点」に固定し、2021年・2022年に投稿された論文を人間執筆の正解データとして、ちょうど0.4%がひっかかるようにスコアの閾値を設定した。

調査の対象は次の通り。

  • 対象分野:コンピュータ科学、定量生物学、電気工学・システム、経済学・金融、応用物理学、統計学、物性物理、高エネルギー物理学、天体物理学、数学の10分野
  • サンプル数:2023年1月〜2026年7月まで各分野・各月おおよそ25本、加えて2021年・2022年のコントロール期間8か月分を追加し、合計12,750本
  • 対象テキスト:各論文のバージョン1(初回投稿版)のPDF本文全体(要旨だけでなく本文全体をスコアリング)

「バージョン1のPDF」を使う理由も明確だ。2026年に改訂された論文が、2023年投稿時点のデータ枠に紛れ込むのを防ぐため。さらに要旨ではなく本文全体をスコアリングしているのは、要旨だけでは信号が弱く出るため。研究チームは「同じ論文が要旨では20%未満、本文では70%超のスコアになるケースを確認した」と述べている。すべての報告数値にはブートストラップ法による95%信頼区間が付与されている。

生成AIの業務活用ルールを設計する際に必要な視点は、
AI導入戦略の全体設計
でもまとめている。数字だけでなく測定設計そのものを見る姿勢は、社内でAIツールを評価する際にも応用できる。

結果 — 直近12カ月で「AI執筆判定」は平均32%、ピークは39%

誤検知率0.4%を基準にした結果、2021年・2022年のコントロール期間はほぼ横ばいの0.4%で推移した。ChatGPT登場後の数か月でこの数値は上昇を始め、2つの波を経て、2026年7月までの直近の完全四半期では約32%まで上昇。2026年初頭には約39%というピークを記録した。

この「コントロール期間が横ばいのまま」という点が、測定設計の妥当性を裏付ける根拠になっている。もし上昇が検出器のアーティファクト(測定上の見かけの現象)に過ぎないなら、2021年・2022年も2026年と同じくらい高く判定されるはずだが、実際にはそうなっていない。

分野別の内訳は下表の通り。すべて2026年7月までの直近12カ月における「AI執筆判定」の割合で、括弧内は95%信頼区間。

分野ChatGPT登場前のコントロール判定率直近12カ月の判定率95%信頼区間
コンピュータ科学0.2%65.0%[59.3%, 70.3%]
定量生物学3.5%56.3%[51.0%, 61.7%]
電気工学・システム1.7%51.3%[46.0%, 57.0%]
経済学・金融2.5%47.0%[41.3%, 52.7%]
応用物理学1.3%34.0%[29.0%, 39.7%]
統計学1.8%31.3%[26.0%, 36.7%]
物性物理0.0%24.0%[19.3%, 29.0%]
高エネルギー物理学0.5%14.0%[10.0%, 18.0%]
天体物理学0.0%10.7%[7.3%, 14.3%]
数学0.0%0.7%[0.0%, 1.7%]

コンピュータ科学が65.0%で最も高く、数学は0.7%で最も低い。約90倍の開きがある。研究チームは、コントロール期間の判定率が高い分野ほど直近の伸びも大きいわけではないと指摘しており、コントロール時点の数値の差だけでは、この分野間格差を説明できないとしている。

検出器の中身 — 3つの専門家モデルと、Claudeの文章が検出されにくい理由

この0.4%という誤検知率がどう作られているかも、unslopは検出器の仕組みを解説する別記事で詳しく公開している。判定の妥当性を評価するには、数字だけでなく「何を学習させた、どういう仕組みの検出器か」を見る必要があるためだ。

検出器は性質の異なる3つの「専門家モデル」の合議制になっている。

  • ニューラル専門家:意味内容を読み取る小型のファインチューニング済みテキスト分類器。長い論文は複数の区間に分けてスコアを平均する
  • 語彙専門家:単語選択・言い回しのパターンを見るモデル。マークアップや書式の違いにほぼ影響されない
  • 文体専門家:文の長さのリズム、句読点の使い方、機能語の癖など60個の文体特徴を見るモデル。話題(トピック)に依存しない

この3つのスコアを検証データで較正したうえで、小型の勾配ブースティング分類器が統合して最終スコアを出す。訓練データは合計約35,000文書。人間側は2019年(ChatGPT登場前)のarXiv要旨約4,800件・論文本文セクション980件に加え、2019年版Wikipedia・凍結されたソフトウェア文書・IETF RFCなど「基準となる文章」で構成。AI側は旧世代の生成モデルのデータセットから、DeepSeek・Gemini・Llamaなど現行の主要モデル、さらに最新のOpenAI・Anthropicモデルに実際のarXiv論文のタイトルと要旨を与えて書かせたテキストまで、世代の異なる生成モデルを幅広く含めている。

誤検知率と検出率はトレードオフの関係にあり、unslopは運用ポイントごとの数値を公開している。

目標誤検知率学術系・人間文章の誤検知率学術AI文章の検出率長文AI文章の検出率
0.2%0.4%83.9%88.9%
0.4%(今回のarXiv調査で採用)0.4%85.0%88.9%
1.0%(ツールの既定値)0.8%88.3%92.6%
2.0%1.3%91.6%93.8%

興味深いのは、この検出精度が生成モデルによって一様ではないという点だ。unslopは「既定の運用ポイントにおいて、多くのモデルファミリーは高い頻度で検出できる一方、Claudeが生成した文章は半分以下の頻度でしか検出できない」と明記している。文体専門家・語彙専門家・ニューラル専門家という3種類の異なる手法を組み合わせてもなお、特定の生成モデルの文章には検出精度の偏りが残るということだ。

Uravationは法人向けAI研修・導入支援で
Claudeを含む複数の生成AIツール活用
を扱っているが、この「モデルによって検出のされやすさが異なる」という事実は、社内で「どのAIツールを使ったかをAI検出ツールで見抜こう」という運用が原理的に成立しにくいことを裏付けている。

測定はどこで壊れるのか — 研究チーム自身が挙げる4つの限界

ここがこの記事の本題である。研究チームは「Limitations(限界)」というセクションを設け、自らの測定の弱点を4つ明示している。数字の派手さよりも、この限界の記述こそが読む価値のある部分だ。

限界1:コントロールサンプルの規模が小さい

各分野のChatGPT登場前コントロールは200本ずつ、合計2,000本。誤検知率0.4%という設定では、この2,000本全体でひっかかるのはわずか8本程度で、それが10分野に分散する。つまり分野ごとのコントロール判定率は粗い近似値にすぎない。研究チームは「全体の基準点(0.4%)はよく推定できているが、分野別のコントロール値はあくまで概算」と述べており、これは控えめな数を増やせば解決する問題でもないと補足している。分野1つあたり1%未満の判定率を精密に測るには、2023年以前のarXiv投稿数では足りないほどの、数千本規模のコントロールデータが必要になるためだ。

限界2:スコアが低いのは「AIを使っていない」からか「検出器の守備範囲外」だからか、区別できない

数学分野が最も分かりやすい例だ。数学論文は数式と定理証明の構造が支配的で、数式や参考文献を取り除くと残る文章量が少なく、検出器が学習した「科学的な英文」とは性質が異なる。そのため、AIの支援を強く受けて書かれた数学論文であっても、文章そのものが検出器の学習データの分布から外れているためにスコアが低く出る可能性がある。つまり数学分野の低いスコアは、「人間が書いた」ことの弱い証拠にしかならない。

研究チームは、この結果は「採用率が低い」のか「検出器の感度がその文体で下がっている」のか、どちらの説明とも矛盾しないとしたうえで、今回のデータだけではこの2つを区別できないと明言している。一方で、文章量が多く検出器の想定に近い分野ほど判定率が大きく伸びている傾向があるため、この分布外の問題が全体の上昇トレンドそのものを説明しているわけではないともしている。判定率が低く出ている分野については、「これは採用の下限値として読むべき」という注釈が付いている。

限界3:検出器のカバー範囲に偏りがある

検出器は生成モデルの種類によって感度が異なり、著者が実際に使っているモデルやプロンプトの組み合わせを研究チームが正確に把握することはできない。カバー範囲が不完全であるほど判定率は低めに出るため、報告されている数値は「下限値」であり、実際の割合はこれと同じか、それ以上である可能性が高いとされている。

限界4:「判定される」ことは「その人が書いた」ことの断定材料にならない

検出器が推定しているのは、あくまで「機械が書いた文章らしく読めるかどうか」の確率であり、既知の誤差率を伴う。軽い編集を加えただけの文章と、全文をAIが生成した文章を区別することはできない。研究チームは「単一のスコアが特定の個人を告発する根拠になることは決してない」と明記しており、報告している判定率には、AIによる大幅な編集支援を受けた文章も含まれるとしている。

「AI率〇〇%」を数字だけで信じてはいけない理由 — 日本企業への示唆

この4つの限界を踏まえると、この調査から言えるのは「新規arXiv論文の一定割合がAIの関与を示すシグナルを含んでいる」という傾向であって、「論文のXX%をAIが書いた」という断定ではない。研究チーム自身がこの区別を強調している点が、この記事の最も実務的な価値だ。

これは日本企業がAI検出ツールを社内ルールや採用選考、学生対応に使う際にもそのまま当てはまる。当社が公開している
日本語対応の無料AIチェッカー
も、この構造を踏まえて「AI率(参考値)」という表記にとどめ、判定を断定しない前提を隠さずに根拠と限界まで表示する設計にしている。海外の主要な検出ツールでも人間の文章を一定割合誤判定することが公式に報告されており、これはunslopの調査が示した「誤検知率をまず固定する」という発想と同じ地点に立っている。

主要なAIチェッカー7種の精度比較や選び方は
AIチェッカーおすすめ7選比較
で詳しく解説している。「丁寧に書くほど構成が整い定型表現が増えるため、AIチェッカーにはAIらしく見える」という現象は、今回のunslop調査の「限界2」(検出器の分布外問題)と同じ根っこを持つ。数字の高さや低さだけを見て、AI使用の有無を断定する運用は避けるべきだ。

特に日本企業が注意すべき点がもう一つある。unslopは検出器の限界として「非ネイティブ英語話者による科学文章は、既知の誤検知リスクである」と明記している。英語論文・英語提案書を日本語ネイティブが書いた場合、文体の癖が検出器の学習データ(ネイティブの科学英語)から外れやすく、誤って「AI執筆」と判定されるリスクが相対的に高くなるということだ。英文の社内文書・海外向け提案書にAI検出ツールを使う企業は、この点を運用ルールに明記しておくべきだ。

AI活用、何から始めればいい?

100社以上の研修実績をもとに、30分の無料相談で貴社の課題を整理します。

無料相談はこちら

大学・企業がAI検出ツールを使うときに注意すべきこと

教育現場ではすでに、AIチェッカーの誤判定が学生とのトラブルに発展するケースが報告されている。当社では
大学レポートのAIチェッカー誤判定|学生の証明法・教員の注意点
で、誤判定が起きた際の学生側の証明手順と、教員側が判定を単独の証拠にしないための運用ルールをまとめている。

企業の場合も構造は同じだ。社内文書や採用選考でAI検出ツールのスコアを使う際は、次の3点を運用ルールに明記しておくことが望ましい。

  • 単一のスコアを懲戒・評価・不採用の唯一の根拠にしない
  • ジャンル(定型文書・専門分野の文章)によって検出精度が大きく変わることを判定者が理解している
  • 疑義が生じた場合は、下書きの編集履歴や執筆過程のヒアリングなど、スコア以外の材料と併用する

「AIで書いてよい文書・ダメな文書」の線引きから、社内のチェック体制の設計まで、実務レベルで整理したい場合は、当社の生成AI活用ルール策定支援でも個別に相談を受けている。

よくある質問

この調査は「arXiv論文の32%をAIが書いた」と断定しているのですか?

いいえ。研究チームは「32%は機械執筆と読める文章として判定された割合」であり、単一のスコアを個人の執筆行為の断定材料にすべきではないと明言しています。判定にはAIによる大幅な編集支援を受けた文章も含まれます。

なぜ数学分野だけAI判定率が0.7%と極端に低いのですか?

数学論文は数式と定理証明が中心で、検出器が学習した文章パターンとは性質が異なるためです。研究チームはこれを「AIの採用率が低い」可能性と「検出器の感度がその文体で下がっている」可能性の両方が考えられ、今回のデータではどちらか特定できないと説明しています。

誤検知率0.4%という数字はどういう意味ですか?

ChatGPT登場前(2021年・2022年)に投稿された、AIが関与していないはずの論文のうち、検出器が誤って「AI執筆」と判定してしまう割合です。この基準を固定したうえで、他の期間・分野の判定率を比較しています。

日本企業がAIチェッカーの数値を使う際に最も注意すべき点は何ですか?

スコアを単独の証拠として扱わないことです。ジャンルによって精度が大きく変動すること、軽微な編集と全文生成の区別がつかないことを踏まえ、執筆過程のヒアリングなど他の材料と併用する運用ルールを事前に決めておくことが重要です。特に英文の非ネイティブ執筆は誤検知リスクが相対的に高いとされています。

Claudeで書いた文章はAIチェッカーで検出されにくいのですか?

今回の検出器の仕様公開記事によれば、既定の運用ポイントにおいて他の主要な生成モデルファミリーに比べ、Claude出力の検出率は明確に低いと報告されています。ただしこれは特定の検出器1つの傾向であり、すべてのAIチェッカーに当てはまるとは限りません。特定モデルの検出されやすさをもとに「バレなければよい」という運用を勧める趣旨ではなく、AI活用の透明性を確保する社内ルールの整備が優先されるべきです。

まとめ:今日から始める3つのアクション

  1. 今日:自社や学校で使っているAI検出ツールが、判定の限界(誤検知率・ジャンル依存性)をどこまで開示しているか確認する
  2. 今週中:AIチェッカーのスコアを人事評価・学生指導・懲戒の唯一の証拠として使っていないか、既存の運用フローを点検する
  3. 今月中:「AI率〇〇%」の数値を扱う際の社内ルール(単独証拠にしない・執筆過程のヒアリングを併用する等)を文書化する

次回予告:次の記事では、AI生成コンテンツの真正性を証明する技術動向についてさらに実践的な視点でお届けします。

参考・出典


著者:佐藤傑(さとう・すぐる)
株式会社Uravation代表取締役。X(@SuguruKun_ai)フォロワー約10万人。
100社以上の企業向けAI研修・導入支援。著書『AIエージェント仕事術』(SBクリエイティブ)。
SoftBank IT連載7回執筆(NewsPicks最大1,125ピックス)。

ご質問・ご相談は お問い合わせフォーム からお気軽にどうぞ。

無料・初回相談

AI導入、要件整理から一緒にやります

100社以上・研修4,200名以上の実績。ツール選定から設計・社内展開まで、実務目線で伴走します。

  • 100社以上・研修4,200名以上の実績
  • 初回30分無料・即日返信

お問い合わせフォームから24時間以内にUravation担当者がご返信します。

佐藤傑
この記事を書いた人 佐藤傑

株式会社Uravation 代表取締役CEO/生成AIエバンジェリスト。法人向けAI研修・コンサルティングを手がけ、日経・SBクリエイティブ・GMO等のメディアで生成AIについて執筆。

この記事をシェア

Claude Codeを本格的に使いこなしたい方へ

業務に合わせたマンツーマン指導で、Claude Codeを実務に組み込める状態まで伴走します。
現役エンジニアが貴方の業務に合わせてカリキュラムをカスタマイズ。

✓ 1対1のマンツーマン ✓ 業務に合わせた設計 ✓ 実務ベースの指導
Claude Code 個別指導の詳細を見る まずは無料相談

Contact お問い合わせ

生成AI研修や開発のご依頼、お見積りなど、
お気軽にご相談ください。

Claude Code 個別指導(1対1・12セッション)をご希望の方はこちらから別途お申し込みください

Claude Code 個別指導 無料相談