robots.txt 在线生成器

robots.txt 在线生成器

开始使用 robots.txt 在线生成器

Gotokit所有工具可直接在线使用,无需下载,无需登录。

🤖 robots.txt 在线生成器

可视化生成、语法校验、一键复制与下载,适合静态站点与个人站长快速上手。

模板
站点基础配置
快捷开关
实时预览
语法校验
配置有效

当前未发现明显语法问题,可以直接部署。

编辑模式

推荐新手使用,勾选爬虫并添加规则即可自动生成。

爬虫与路径规则

关于这个工具

适用于海外个人站长、独立站和静态站点的 robots.txt 在线生成工具。通过可视化方式选择 Googlebot、Bingbot、AhrefsBot 等主流爬虫,添加 Allow/Disallow 路径规则,并实时检查重复爬虫、冲突路径和 Sitemap 格式问题。

  • 100% 免费使用,无次数限制
  • 无需注册或登录
  • 在浏览器中直接运行
  • 更注重隐私与处理效率

说明文档

一、工具总览

1. 工具基础介绍

Gotokit robots.txt 在线生成器是一款本地浏览器运行、零登录、全免费的可视化爬虫规则配置工具,遵循 RFC 9309 Robots Exclusion Protocol 标准,专为个人站长、独立站、静态博客、电商站点、Astro 等静态项目设计。

它的核心能力包括:

  • 可视化勾选主流爬虫 User-agent
  • 批量配置抓取白名单与黑名单路径
  • 实时语法校验与冲突提示
  • 一键复制、下载标准 robots.txt
  • 支持纯文本模式反向解析并回填可视化表单

这意味着新手可以零代码完成配置,专业用户也可以直接手写规则并继续使用校验能力。

2. 核心基础概念

robots.txt 文件是什么

robots.txt 是放在网站根目录下的纯文本文件,访问地址通常为 https://你的域名/robots.txt
它相当于告诉搜索引擎爬虫“哪些内容允许访问,哪些内容不建议抓取”的访问准入协议。

协议核心逻辑

当正规搜索引擎爬虫访问网站时,通常会优先读取根目录 robots.txt,然后根据匹配到的 User-agent 执行对应的 Allow / Disallow 路径规则。

需要注意:

  • 主流搜索引擎与正规 SEO 工具爬虫通常会遵守该协议
  • 恶意采集脚本、违规抓取器不一定遵守

抓取和索引的区别

  • robots.txt:控制抓取,也就是爬虫能不能下载页面源码
  • noindex:控制索引,也就是页面会不会出现在搜索结果里

如果你希望页面彻底不出现在搜索结果中,通常需要配合页面 meta robots noindex 或 HTTP 响应头中的 X-Robots-Tag: noindex,不能只依赖 robots.txt

本地运算说明

本工具的配置解析、语法校验、文本生成都在浏览器本地完成,不会把你的域名、规则内容、Sitemap 地址上传到服务器。

二、顶部导航栏功能逐项释义

首页 / 全部工具 / 编程开发

  • 首页:返回 Gotokit 首页,查看全站工具入口
  • 全部工具:查看所有免费在线工具,包括格式化、生成、加密、图片、PDF 等类型
  • 编程开发:当前工具所属分类,主要集中提供站长、前端、后端开发辅助工具

三、页面主模块分层详解

模块 1:开始使用区域

  • 标题:🤖 robots.txt 在线生成器
  • 辅助说明:Gotokit 工具无需下载、无需登录、可直接在线使用

这部分的作用是让用户明确知道:本工具没有使用次数限制、无需注册、没有付费门槛,打开页面即可直接配置、复制、下载文件。

模块 2:模板快速套用

模板区用于一键加载预设规则,减少手工配置成本。

1)通用网站模板

适用场景:

  • 企业官网
  • 资讯站
  • 内容站

默认思路:

  • 允许主流搜索引擎抓取
  • 屏蔽常见后台、临时、私密目录,如 /admin//private//tmp/
  • 预留 Sitemap 填写位置

2)静态博客 / 工具站模板

适用场景:

  • Astro
  • VitePress
  • Hugo
  • 在线工具站

默认思路:

  • 放行图片与视频类爬虫
  • 屏蔽草稿目录 /draft/
  • 屏蔽预览页面 /preview/
  • 屏蔽内部接口 /api/internal/
  • 不主动拦截公开静态资源 /assets/

3)电商网站模板

适用场景:

  • 独立站
  • 跨境电商
  • 商城站点

默认思路:

  • 屏蔽购物车、结算页、用户中心、筛选参数页
  • 允许商品公开页面抓取
  • 尽量减少重复参数页面对 SEO 的干扰
  • 预留兼容商品、分类等多 Sitemap 的写法

4)完全屏蔽模板

适用场景:

  • 测试站
  • 内部演示站
  • 未上线站点

默认思路:

User-agent: *
Disallow: /

这表示禁止所有爬虫抓取整个站点。只建议临时使用,不适合长期挂在正式网站上。

模块 3:站点基础配置区

这里有两个核心输入项:网站域名Sitemap 地址

1)网站域名

功能:

  • 用于辅助标准化 URL
  • 用于自动补全 Sitemap 完整地址
  • 不会直接写入最终 robots.txt 正文

填写建议:

  • 尽量填写完整地址,例如 https://demo.com
  • 建议带上 https

2)Sitemap 地址

功能:

  • 生成 Sitemap: 完整URL 指令
  • 主动告诉搜索引擎你的站点地图位置

填写规范:

  • 使用完整绝对地址,如 https://demo.com/sitemap.xml
  • 如果有多条 Sitemap,可换行分别填写
  • 不填写时,工具不会输出 Sitemap: 指令,但不影响基础规则生成

模块 4:快捷开关

允许所有爬虫

会自动生成接近下面的全局规则:

User-agent: *
Disallow:

这里 Disallow 留空,表示默认允许全站抓取。之后你仍然可以继续补充具体的黑名单路径。

禁止所有爬虫

会自动生成:

User-agent: *
Disallow: /

表示全站默认拒绝抓取。之后如果你需要单独放行某些爬虫,可以继续在下方新建规则组覆盖。

模块 5:实时预览操作按钮组

复制代码

把当前预览区中的完整 robots.txt 文本复制到剪贴板,方便你直接粘贴到服务器根目录中新建文件。

下载 robots.txt

浏览器本地导出标准命名的 robots.txt 文件,无需手动重命名。

重置

清空表单配置、清空预览文本、重置校验状态,回到初始状态,方便重新生成一套新规则。

模块 6:语法校验提示栏

这个模块会实时提示当前配置是否可靠。

配置有效

表示当前未检测到明显问题,例如:

  • 没有重复 User-agent
  • 没有明显的路径冲突
  • Sitemap URL 格式正确

常见异常场景

  • 重复爬虫组:同一个 User-agent 被多次定义
  • 路径语法错误:路径没有以 / 开头,或格式不标准
  • Sitemap 格式错误:只写了相对路径,或缺少 http/https
  • 规则冲突:同一爬虫组里同时出现上级 Disallow 与下级 Allow

一般情况下,Allow 对更具体路径的优先级会高于上级 Disallow,但仍建议人工复核。

模块 7:编辑模式切换

可视化编辑

推荐新手使用。你只需要:

  • 勾选爬虫
  • 选择规则类型
  • 输入路径

系统会自动生成对应文本,并同步到预览区。

纯文本模式

适合熟悉 robots.txt 语法的用户。你可以直接手写完整规则文本,系统会在可能的范围内解析并同步回表单。

这在以下场景特别有用:

  • 批量复杂规则
  • 特殊自定义爬虫
  • 希望手工精细控制文本结构

模块 8:爬虫与路径规则核心配置区

8.1 基础说明

每一个规则组只作用于当前组已选中的 User-agent
你可以创建多个组,让不同爬虫拥有不同的抓取规则。

例如:

  • 组 1:给全部爬虫统一屏蔽 /admin/
  • 组 2:只给 AhrefsBot 额外屏蔽更多目录

8.2 添加爬虫组 / 复制组

添加爬虫组

  • 新建一组独立规则
  • 不同组之间互不干扰

复制组

  • 一键复制当前组的已选爬虫与路径规则
  • 适合在相似规则基础上快速改少量内容

8.3 预设爬虫勾选面板

全部爬虫 (*)
  • 对应:User-agent: *
  • 作用:通配所有主流搜索引擎爬虫、SEO 工具爬虫以及部分 AI 爬虫
  • 适合放在第一组,写全站通用规则
Googlebot
  • Google 网页主爬虫
  • 负责抓取网页正文内容
  • 海外站点通常建议允许
Googlebot-Image
  • Google 图片抓取爬虫
  • 负责图片搜索索引
  • 图库、图文博客通常建议允许
Googlebot-Video
  • Google 视频抓取爬虫
  • 负责视频页与视频资源抓取
  • 没有视频内容的网站可以不必单独放行
Bingbot
  • Microsoft Bing 搜索引擎主爬虫
  • 对海外流量和国内必应搜索都有效
DuckDuckBot
  • DuckDuckGo 搜索爬虫
  • 更偏向海外隐私搜索流量
AhrefsBot
  • Ahrefs SEO 工具爬虫
  • 常用于外链、页面、SEO 数据分析
  • 如果服务器压力较大,很多站点会选择屏蔽
SemrushBot
  • Semrush SEO 竞争分析工具爬虫
  • 常用于关键词与排名监控
  • 服务器资源有限时也常被屏蔽
YandexBot
  • Yandex 搜索引擎爬虫
  • 面向俄语区、东欧市场的网站通常建议允许
Baiduspider
  • 百度搜索主爬虫
  • 面向中文站、国内流量时通常建议允许

8.4 自定义 User-agent

如果预设列表里没有你要的爬虫,可以手动添加,例如:

  • Applebot
  • GPTBot
  • CCBot
  • facebookexternalhit

常见含义:

  • Applebot:苹果 Siri / Spotlight 检索相关爬虫
  • GPTBot:OpenAI 相关抓取标识,部分站点会选择屏蔽
  • CCBot:Common Crawl 抓取器

8.5 路径规则配置面板

Allow

  • 表示允许当前组选中的爬虫抓取指定路径
  • 常用于“父目录屏蔽、子目录单独放行”的情况

Disallow

  • 表示禁止当前组选中的爬虫抓取该路径

路径填写规范:

  • 必须以 / 开头
  • 可以写目录,也可以写单页面

例如:

  • /admin/
  • /private.html

点击 添加规则 后,本条路径规则会保存到当前组中。一个组里可以有多条 Allow / Disallow

8.6 快捷路径一键追加

/assets/
  • 通常是图片、CSS、JS、字体等静态资源目录
  • 大多数公开网站会允许抓取
/admin/
  • 后台管理目录
  • 往往包含敏感配置与登录入口
  • 通常建议禁止抓取
/preview/
  • 预览页、草稿预览页
  • 一般没有 SEO 价值
/tmp/
  • 临时缓存或临时上传目录
  • 内容不稳定,通常不建议抓取
/api/internal/
  • 内部接口目录
  • 面向系统调用,不面向搜索引擎
/search/draft/
  • 草稿、未发布稿件目录
  • 通常建议禁止抓取
/private/
  • 会员私密内容、内部文档或隐私页面目录
  • 通常建议禁止抓取

四、推荐使用流程

  1. 先选择最接近网站类型的模板
  2. 填写网站域名与 Sitemap 地址
  3. 使用快捷开关决定默认开放还是默认屏蔽
  4. 在规则组中勾选爬虫并添加路径规则
  5. 查看实时预览是否符合预期
  6. 查看语法校验是否存在错误或警告
  7. 复制或下载 robots.txt 并部署到网站根目录

五、使用提醒

  • 生成的 robots.txt 内容本身不随页面语言变化
  • 所有生成与校验都在浏览器本地完成
  • robots.txt 管的是抓取,不等于一定禁止索引

最后更新:2026-08-01

常见问题

什么是 robots.txt?

robots.txt 是放在网站根目录下的文本文件,用来告诉搜索引擎爬虫哪些路径可以抓取,哪些路径不建议抓取。

如何测试 robots.txt 是否生效?

部署后先直接访问 /robots.txt,确认浏览器能打开;再结合 Search Console、Bing Webmaster Tools 或日志观察抓取情况。

robots.txt 会不会阻止页面被索引?

不一定。robots.txt 主要控制抓取,不等于 noindex。某些页面即使被阻止抓取,仍可能因为外部链接而出现在搜索结果中。

Astro 静态站点如何部署 robots.txt?

将生成好的 robots.txt 放到最终站点根目录即可。对 Astro 静态站点来说,确保构建产物部署后可以通过 https://你的域名/robots.txt 直接访问。

robots.txt 和 noindex 有什么区别?

robots.txt 控制“是否抓取”,noindex 控制“是否建立索引”。如果你的目标是不让页面出现在搜索结果里,通常需要用 noindex,而不是只靠 robots.txt。

Cloudflare 环境下需要注意 robots.txt 缓存吗?

需要。更新 robots.txt 后,若 Cloudflare 或浏览器缓存未刷新,搜索引擎可能暂时看到旧版本。修改后建议主动清缓存并再次访问 /robots.txt 验证。

更多编程开发

编程开发全部工具

Token/安全密码生成器

本地运行的安全密码生成工具,支持长度、字符集、高级排除规则与强度评估。

GotoKit在线哈希生成器

GotoKit在线哈希生成器 — 输入文本或拖拽文件,一键生成MD5/SHA1/SHA256/SHA384/SHA512五种哈希值。实时更新、HMAC模式、大小写切换、一键复制。纯浏览器本地计算。

MD5在线加密工具 - 密码生成与哈希比对

在线MD5加密工具,支持文本MD5生成、安全密码生成器(含MD5哈希)、MD5哈希比对三种模式。纯浏览器本地计算,数据不上传。

JSON 格式化器 & 验证器

基于 vanilla-jsoneditor 的在线 JSON 格式化、压缩、复制、下载、自动修复与验证工具,简洁且支持高级模式。

在线 YAML ↔ JSON 相互转换工具

免费在线 YAML 与 JSON 互转工具,粘贴即可双向转换,支持语法校验、复制、下载和清空。适用于配置文件(Docker/K8s/CI/CD)、API 文档和数据交换。

在线 XML 格式化 / 压缩 / 校验工具

免费在线 XML 格式化、压缩与校验工具。粘贴 XML 即可美化排版、压缩体积或实时语法校验,支持可配置缩进、属性排序和空元素折叠。所有处理在浏览器本地完成。

URL 在线编码解码工具

免费在线 URL 编码解码工具 — 支持批量处理、encodeURI / encodeURIComponent 双模式、空格处理(%20 / +)、智能识别编码状态。一键去除跟踪参数、内置编码对照表和代码示例。纯浏览器本地运算,数据不上传。

XML Sitemap 在线生成器

免费在线 XML Sitemap 生成工具,粘贴 URL 列表即可生成标准 sitemap.xml,支持 lastmod/changefreq/priority 批量设置、URL 去重校验、CSV/TSV/旧 sitemap 提取,超过 5 万条自动生成 sitemapindex 分卷。纯前端本地运行。

正则表达式测试器

在线正则表达式测试工具,支持实时匹配、高亮显示、语法解释和测试用例管理。

Cron 表达式生成器 - 在线定时任务表达式解析工具

在线 Cron 表达式生成器和解析器。可视化构建定时任务表达式,支持人类可读翻译和下次执行时间预览,内置 6 个常用模板。

浏览全部分类