← Glossary
Definition
robots.txt
robots.txt is a root-level file that grants or denies crawler access per user-agent token. In the AI era it carries a distinction most sites get wrong: training crawlers and answer-engine indexers are separate agents.
Blocking GPTBot opts you out of OpenAI training but leaves ChatGPT citations intact; blocking OAI-SearchBot removes you from ChatGPT's citable index entirely.
Some agents — notably user-initiated fetchers — state that they are not governed by robots.txt, so enforcement there requires CDN rules.
Related terms
Nostimates measures robots.txt across twelve AI answer surfaces. Request access →
All terms
AEO (Answer Engine Optimisation)GEO (Generative Engine Optimisation)AI OverviewsAI ModeCitation sharen-samplingQuery fan-outGroundingShare of voice (AI)Extraction success rateSurfaceAnswer engineCitationBrand mentionMention rateConfidence intervalStatistical significanceCitation volatilityNon-determinismReproducibilityIdentity-free collectionPersonalisationLocaleResidential proxyBot detectionCollection costCreditEvidence retentionAudit trailParser versionCanary promptData freshnessCadencePrompt setHead termLong-tail queryCompetitive setllms.txtAI crawlerTraining crawlerRetrieval-augmented generation (RAG)HallucinationAnswer boxFeatured snippetZero-click searchEntityEntity salienceKnowledge graphStructured dataJSON-LDschema.orgFAQ schemaAnswer-first contentChunkEmbeddingSemantic searchPrompt injectionMarket coverageSentiment analysisPosition trackingWhite-label data