AIに読ませる前に、締め出していないか|自社サイトで確かめる3つの方法

AI・AIO/LLMO

構造化データを入れても、AIの回答に自社が出てこない。その前に確かめることがあります。AIは自分でサイトを読みに来ますが、その入口を、会社が知らないうちに閉じていることがあるからです。この記事では、その入口を自分のサイトで確かめる方法を、実際に測った数値とあわせて書きます。

AIは、あなたのサイトを読みに来ている

ChatGPTやGeminiに「◯◯の会社を教えて」と聞くと、答えの中に会社名が出てきます。あの答えは、AIが頭の中だけで作っているわけではありません。多くの場合、AIを動かしている会社のプログラムが、実際にWebサイトを訪問して本文を読み取り、その内容をもとに答えを組み立てています。

訪問しているのは人ではなく、自動で巡回するプログラムです。人が見るブラウザとは別の名前を名乗ってやってきて、サイトの中身を読み、持ち帰ります。そして、ここが大事なところですが——サイト側には、その訪問を断る仕組みが最初から備わっています。

断る設定は、悪意なく入ってしまいます。制作会社がテスト中に入れた設定が残っていた。サーバーの管理会社が、負荷対策として自動巡回プログラムをまとめて遮断していた。セキュリティ対策のサービスを入れたとき、標準設定で弾く対象に入っていた。どれも珍しい話ではありません。

そして、断っていることは画面には出ません。サイトは普通に表示され、人は問題なく読めます。読めていないのはAIだけで、しかもそれを教えてくれる人はいません。

同じ入口。シャッターの下端にわずかな光の線が入り、床の光の点が入口へ向かって並んでいる
確かめる作業は、どこで止まっているかを一つずつ見ていくことから始まる。

まず、自分のサイトで確かめる

確かめる方法は3つあります。いずれも費用はかかりません。

ひとつ目:入口の扉を見る

サイトのアドレスの末尾に /robots.txt をつけてブラウザで開いてください。たとえば当社なら https://lap-up.com/robots.txt です。ここに、どのプログラムに何を許すかが書かれています。

見るべきは Disallow という行です。これが「入るな」の指定です。会社名や製品名らしき文字列——GPTBot、ClaudeBot、PerplexityBot、Google-Extended、CCBot——のあとに Disallow: / と書かれていたら、そのプログラムはサイト全体を読めません。

当社の場合、記事執筆時点では管理画面だけを除外し、それ以外は全て許可していました。AI向けの個別指定は書いていません。指定がなければ「全体への許可」が適用されるので、結果としてAIも読める状態です。

ふたつ目:実際に名乗って訪問してみる

扉に書いてあることと、実際に通れるかは別です。サーバー側の設定が、扉の記載と関係なく遮断していることがあります。

確かめるには、AIのプログラムと同じ名前(User-Agent)を名乗って自分のサイトにアクセスし、正常に返ってくるかを見ます。この方法で分かるのは「名前を理由にした遮断が入っていないか」までです。各社の本物のプログラムは決まったアクセス元(公開されているIPアドレス帯)からやって来るため、テスト元から通ったことと、実際の巡回元から取得できていることは、厳密には別です。当社が実際に測った結果が次です。

名乗った名前 応答 受け取った容量 応答時間
GPTBot(ChatGPT) 200 正常 557KB 0.66秒
ClaudeBot(Claude) 200 正常 557KB 0.59秒
PerplexityBot 200 正常 557KB 0.51秒
Google-Extended 200 正常 557KB 0.48秒
OAI-SearchBot 200 正常 557KB 0.53秒
Applebot-Extended 200 正常 557KB 0.48秒

2026年8月16日、当社サイトの実績ページで測定。「200」はサーバーが正常に応答したことを示す番号です。403や503が返る場合は遮断されています。受け取った容量が人のブラウザと大きく違う場合も要注意で、中身を差し替えられている可能性があります。なお、表のうちGoogle-ExtendedとApplebot-Extendedは、単独でWebを巡回するプログラムではありません。既存のクローラー(Googlebot・Applebot)が取得した内容をAIに使ってよいかを制御するための「名前」で、この2行は「その名前を理由に遮断する設定が入っていないか」の確認として載せています。

三つ目:受け取った中身に、本文が入っているか

ここが見落とされやすい点です。応答が正常でも、受け取った中身が空っぽということがあります。

最近のサイトは、画面を開いてからプログラムが動いて文章を組み立てる作りのものがあります。人のブラウザではきちんと表示されますが、最初に届く中身には見出しも本文も入っていません。AIのプログラムは、その組み立てを待たずに持ち帰ることがあります。結果、「訪問はできたが、何も書いていないページ」として扱われます。

当社の実績ページで確認したところ、最初に届く中身の時点で本文が4,381字あり、掲載しているクライアント名も全て含まれていました。組み立てを待たなくても読める状態です。

確かめた結果、当社にもひとつ問題があった

3つとも通っていたので安心しかけたのですが、別の場所に穴がありました。

llms.txt という、AI向けに会社の要点をまとめて置くファイルがあります。当社も設置していました。ところが中身を開いてみると、1か月前の状態のまま更新されていませんでした。その後に公開した実績ページと解説記事が、どちらも載っていません。AIに向けて「うちにはこういうページがあります」と案内する紙を置きながら、案内から新しいページが抜けていたことになります。

この記事を書いた日に、両方を追記しました。ただし、このファイルをAI各社が実際にどれだけ参照しているかは、外から観測できません。効果が確認できたと書くことはできないので、ここでは「置いたが、効果はまだ測れていない」とだけ書いておきます。

同じ入口のシャッターが全開になり、朝の金色の光が奥まで差し込んでいる
通ってはじめて、読ませる設計の話が始まる。

これは対策の順番でいうと、どこか

当社は以前の記事で、着手の順番を「①測る ②矛盾を消す ③中身を足す」と書きました。今回の話は、その①よりさらに前にあたります。

読まれているかどうかを確かめずに構造化データを実装するのは、届いていない相手に丁寧な手紙を書き続けるようなものです。順番としては、まず届いているかを確認する。届いていれば、次に情報の矛盾を消す。それから中身を足していく。

入口が閉じていたときに、何をするか

遮断が見つかった場合、直す場所は原因によって変わります。

  • robots.txt に個別の拒否が書かれていた:制作会社かサイト管理者に、その行を入れた経緯を確認してください。テスト用の設定が残っただけなら削除で解決します。
  • robots.txt は問題ないのに遮断される:サーバー会社やセキュリティサービス側の設定です。管理会社に「自動巡回プログラムの遮断設定を確認したい」と伝えるのが早道です。
  • 本文が届いていない:サイトの作り方の問題なので、制作会社との相談になります。全面的な作り直しをせずに、主要ページだけ最初から本文が入る形にする方法もあります。

いずれの場合も、判断の前に「誰が・いつ・何のために入れた設定か」を確かめてください。AI向けに情報を出したくない、という経営判断で意図的に閉じている会社もあります。その場合は閉じたままが正解です。

この考え方の呼び名

ここまで、専門用語を使わずに書いてきました。最後に名前を渡しておきます。

AIに正しく理解され、正しく推薦されるようにサイトと情報を設計することを、AIO(AI Optimization)やLLMO(Large Language Model Optimization)、GEO(Generative Engine Optimization)と呼びます。呼び方は複数ありますが、指しているものはほぼ同じです。今回扱った「読みに来るプログラムを通すかどうか」は、その中でも最初に確認する土台にあたります。

用語の関係と着手の順番はSEO・AEO・LLMOの違いと、中小企業がやるべき順番に、実際に自社サイトへ実装した内容と数値は自社サイトを、AIに読ませる設計で作り直した全記録に書いています。納品した画面そのものは実績ページで公開しています。

よくある質問

AIのプログラムを通すと、コンテンツを勝手に使われませんか。

読み取られた内容が学習や回答生成に使われる可能性はあります。ただし、二者択一ではありません。たとえばOpenAIは、検索・回答表示用のOAI-SearchBotを許可しながら、学習用のGPTBotだけを拒否する設定を公式に案内しています。「回答での表示は許可するが、学習には使わせない」という中間の選択肢を取れる場合があります(どこまで分けられるかは各社の仕様によります)。当社は用途を分けずに通す判断をしています。

robots.txt に書けば、必ず守られますか。

強制力のある仕組みではありません。主要なAI各社は自社のプログラム名を公開し、この記載に従うと表明していますが、全ての巡回プログラムが従う保証はありません。確実に見せたくない情報は、公開ページに置かないのが原則です。

llms.txt は入れたほうがいいですか。

設置しても害はなく、費用もほとんどかかりません。ただし、各AIがどの程度参照しているかを外から観測する方法が現時点ではないため、当社は「効果を確認できた」とは言えない立場です。効果が不明なものを主要な施策として提案することはしていません。

確認は自社でできますか。

ひとつ目(robots.txtを開く)は誰でもできます。ふたつ目・三つ目は技術的な操作が必要なので、制作会社かサーバー管理会社に「AIのプログラムから見て、サイトが読める状態か確認してほしい」と依頼するのが確実です。当社の無料診断でも、この3点は確認範囲に含めています。

閉じていた場合、直せばすぐAIの回答に出ますか。

出るとは限りません。読める状態にすることは前提条件であって、選ばれる理由そのものではありません。読める状態にしたうえで、情報の矛盾を消し、他社と比較されたときの判断材料を書いておく必要があります。当社も自社サイトで検証を継続しており、結果が出た時点で数値とあわせて公開します。

2026年9月9日 訂正:本記事の試験は「クローラーの名前を名乗ったアクセスにサーバーが応答するか」の確認であり、各社の本物のプログラムの訪問記録ではありません。またGoogle-ExtendedとApplebot-Extendedは独立して巡回するプログラムではなく、取得済みコンテンツの利用可否を制御する名前です。あわせて「表示の許可と学習の拒否は両立しない」としていた記述を、用途別に分けられる場合がある旨へ訂正しました。誤りのご指摘を歓迎します。

タイトルとURLをコピーしました