AI画像判定ツールの本当の精度 : クリエイティブディレクターが知るべきこと
要約
AI画像判定ツールは統計パターンで本物と生成を分類するが、圧縮やスクリーンショットで精度は大きく低下。重要な画像には200%ズーム、元ファイル確認、複数ツール比較、逆画像検索、プロヴェナンス確認の5ステップを実行する。信号がない場合、それは証拠ではない。
スクリーンにある画像。質問はシンプルだ:これ本物?それとも生成物?
AI画像判定ツールなら3秒で確率を示してくれる。ただ、その数字が実際に当たる確率は、インターフェイスが暗示するほどは高くない。ここに、何が信頼できるのか、何が崩れるのか、そしてクリエイティブディレクターがクライアントのデックに入れる前に実行すべき手順をまとめた。
ショートバージョン:判定ツールは裁判官じゃなく、火災警報機だと思え。
AI画像判定ツールは実際に何を見てるのか
ほとんどの判定ツールは分類器だ。2つのデータセット:カメラからの写真と、Midjourney、Stable Diffusion、DALL-Eといった生成AIの出力で学習している。習得するのは統計的なパターン。ノイズの癖、周波数成分の傷、モデルが細部を埋めるときにテクスチャがどう繰り返すか。
それが全部。魔法はなく、両方のデータセットをたくさん見た機械学習モデルってだけだ。これが最大の弱点も説明する。判定ツールの精度は、それが学習した生成AIと同じレベル止まり。そしてジェネレーターは3ヶ月ごとに進化する。
ツールの中にはメタデータとウォーターマークを読む層を足すものもある。それはまた別の話で、後で扱う。

実際のところ精度はどれくらいか
調査者次第。8つのツールを実写真とMidjourney v6、DALL-E 3、Stable Diffusion出力で走らせた記事がある。Hive Moderationは約94%、Illuminartyは約91%と報告している。圧縮なし・編集なしのきれいなファイルなら、まともな数字だ。
ただ細かい条件を読むと、現実の精度は後処理と圧縮で大きく変わると認めてる。ベンダーが出す精度数字は、自分のレストランを自分でレビューするようなもんだ。
あなたが10分で試せるテストはこれだ。出所が確かなファイル3グループを用意する:
Midjourney v7とFluxからの直出力
スクリーンショット後、JPEG再圧縮したそのファイル
実写真・スキャン。古いフィルムストック含め
3つ見えてくる。きれいな生成は大抵キャッチされる。再圧縮版は目に見えて少なくキャッチされる。実写真、特に柔らかいか過度に修正されたやつは、AIとしてフラグが立つことがある。この3番目のグループを誰もランディングページには置かない。
ベンダーは偽陽性率を公表する。あるツールは、2022年以前の人手制作画像1万枚で0.16%のフラグ率を示している。印象的だけど、ベンダー自身の限定データセットでのテスト。過度に修正された、過シャープなクライアント写真は、そのテストセットじゃない。
1つのスコアをどーんと表示するだけのツールは避けろ。使う価値があるのは:画像のどこが怪しいか領域を示すツール。不確実さを認めるツール。
なぜスクリーンショットと再保存が結果を壊すのか
証拠は繊細な場所に住んでる。分類器が頼るピクセルレベルの指紋は、リサイズ、再圧縮、フィルター処理でぐちゃぐちゃになる。Instagram、X、ほぼ全チャットアプリはアップロード時に全部やる。
メタデータも同じ。Content CredentialsとEXIFはファイルコンテナに入ってるが、プラットフォームは定期的に削除する。ない署名情報は何も証明しない。画像が偽りってわけじゃなく、本物ってわけでもない。
これが多くの人が見落とす部分。信号がないことは、信号じゃない。

ウォーターマークと認証情報:より良い証拠、カバレッジは限定的
2026年で重要なのは2つのシステムだ。C2PA標準のContent Credentials。ツールと編集内容の署名レコードをファイルに組み込む。SynthIDスタイルのウォーターマーク。生成時にピクセルに見えない信号を埋める。このC2PA対SynthIDの解説がよく説明してる:認証情報ファイルの由来を教え、ウォーターマークはどのツールが作ったか教える。両方とも、生成AIが協力しなきゃ動かない。
あるときは任意の分類器より強い。有効な署名は推測じゃなく、証拠だ。
問題はカバレッジ。オープンソース model はローカルで動くから、誰も何も記録する必要がない。参照がローカルで実行したFluxやSD3.5から出たなら、何も期待するな。このルール盗め:肯定的なプロヴェナンスヒットは強力。負のヒットは沈黙。
クリエイティブディレクターの手順:結果を信じる前に5つをチェック
判定ツールは1つの入力に過ぎない。仕事の流れはこれだ。
最初に200%で見る。手、歯、ジュエリー、看板のテキスト、髪が背景と出会う部分。古い手がかりだけど、雑な生成はまだ引っかかる。
元ファイルを求める。カメラRAWやレイヤーPSDはいかなるスコアより価値がある。
判定ツール2つ走す、1つじゃなく。意見が割れたら、その割れ目が君の発見だ。
逆画像検索。本物の写真は大抵履歴を持つ。新しい生成は履歴なし。
ファイルにプロヴェナンスデータが残ってたらチェック。
これら全部が速い作業じゃない。速い必要もない。本当に重要な画像でだけやる:クライアントのブリーフ、コンテスト出品、クレジット予定のソース。

判定ツールが60%と言ったとき何を意味するのか
ほぼ何も意味しない。分類器の出力は model の確信度であって、現実で画像が偽りである確率じゃない。ツールによってキャリブレーション違うから、一方の60%は別の85%と同じ意味かもしれない。
2つのルール。1つ:中間帯は無視。大体30%~70%の間は、ツールが肩をすくめてる。2つ:製品をまたいでスコア比較するな。同じ画像の判定を比較して、どこで食い違うか見ろ。
食い違いが面白い。一方が92% AI、他方が8%なら、どちらかはそのモデルで訓練されてないか、転送中にファイルが壊れた。元に戻って、元ファイル求めて、メタデータ再チェック。
どの画像が判定ツールを最も騙すのか
いくつかのカテゴリは確実に難しい。信じる前に知っといた方がいい。
高度にスタイル化された作品。Risoプリント風、フラット図解、グレイン フィルム風:スタイルがカメラから遠いほど、訓練された分類器は頼るものが少ない。
アップスケーを経たファイル。生成後に追加された細部は、元のモデルの指紋を濁す。
小さい切り抜き。400pxサムネイルは全サイズより情報が少ない。
ハイブリッド画像。実写真にAI生成の空、またはAI生成の肖像にリアル修正を混ぜたもの。設計上グレーゾーン。多くのツールはファイル全体で1スコア返すから、正直な答えは「部分的」のことが多い。
リリースされたばかりの model。判定ツールの最後の学習後に出た生成AIはブラインドスポット。ベンダーが追いつくまで数週~数ヶ月。
Are.naやストック写真、SNSから参照を集めるなら、かなりはハイブリッドと考えろ。ムードボードで標記して、ソース書いて、先へ。
生成AIツール自身は何をしてるのか
君が既に使ってる model がこの問題の理由だから、ラベリング対応で各ツールはどこに立つか見よう。
Midjourneyの出力は磨かれたもの。バージョンが上がるたび「出来がよすぎ」という手がかりは弱くなる。
Adobe Fireflyはデフォルトで認証情報に頼る。ファイルは一番検証しやすくなる。メタデータが消されてなきゃの話だが。
Kreaは多くのやつがリアルタイムで反復してるツール。高速ループ、豊富なスタイル、出所への言及なし。
アップスケーラーもここで重要。生成をMagnificで処理すると本物のテクスチャが加わる。そのテクスチャは、素出力で訓練された分類器をぴったり混乱させる。判定ツール試すなら、アップスケーされたファイルでも試してみろ。
率直に:これらのツールで君の検証の仕事を楽にしてくれるものは1つもない。その仕事は君のもんだ。
クライアント仕事で判定ツールに頼るべきか
トリアージとして使うなら価値がある。フラグが立った画像は詳しく見る。きれい判定は「アラーム鳴らなかった」以上の何も買わない。
スコアを紛争の証拠、削除依頼の根拠、コンテスト判定に使いたくなったらやめろ。本物アートの偽陽性は嫌な部分だ。写真家とイラストレーターが1つのツールの出力だけで告発されたことがある。平坦なスコアはそれを守るには弱すぎる。
やることはこれ:プロセスを書く。どのツール、どのバージョン、いつ、どのファイル。スコアのスクショより、日付入りノートの方が遥かに強い。
そしてお前が画像を作ってるなら、作業ファイルを保つ。レイヤー、シード、プロンプト、醜い初期ドラフト。アートディレクターが買える最も安い保険。そしてそれはムードボード整理としても優秀だ。
次のステップ
5つのファイルを用意しろ。3つは確実に本物、2つ生成。2つの判定ツール通す。スクショ撮って再度。ランディングページより、その時間で学ぶことが多い。
その後、自分のスタックで試験をリミックスしろ。お前のお気に入りのどの model が最初に引っかかる。どれが引っかからない。