robots.txt 在线生成器
开始使用 robots.txt 在线生成器
Gotokit所有工具可直接在线使用,无需下载,无需登录。
🤖 robots.txt 在线生成器
可视化生成、语法校验、一键复制与下载,适合静态站点与个人站长快速上手。
当前未发现明显语法问题,可以直接部署。
推荐新手使用,勾选爬虫并添加规则即可自动生成。
关于这个工具
适用于海外个人站长、独立站和静态站点的 robots.txt 在线生成工具。通过可视化方式选择 Googlebot、Bingbot、AhrefsBot 等主流爬虫,添加 Allow/Disallow 路径规则,并实时检查重复爬虫、冲突路径和 Sitemap 格式问题。
- 100% 免费使用,无次数限制
- 无需注册或登录
- 在浏览器中直接运行
- 更注重隐私与处理效率
说明文档
一、工具总览
1. 工具基础介绍
Gotokit robots.txt 在线生成器是一款本地浏览器运行、零登录、全免费的可视化爬虫规则配置工具,遵循 RFC 9309 Robots Exclusion Protocol 标准,专为个人站长、独立站、静态博客、电商站点、Astro 等静态项目设计。
它的核心能力包括:
- 可视化勾选主流爬虫
User-agent - 批量配置抓取白名单与黑名单路径
- 实时语法校验与冲突提示
- 一键复制、下载标准
robots.txt - 支持纯文本模式反向解析并回填可视化表单
这意味着新手可以零代码完成配置,专业用户也可以直接手写规则并继续使用校验能力。
2. 核心基础概念
robots.txt 文件是什么
robots.txt 是放在网站根目录下的纯文本文件,访问地址通常为 https://你的域名/robots.txt。
它相当于告诉搜索引擎爬虫“哪些内容允许访问,哪些内容不建议抓取”的访问准入协议。
协议核心逻辑
当正规搜索引擎爬虫访问网站时,通常会优先读取根目录 robots.txt,然后根据匹配到的 User-agent 执行对应的 Allow / Disallow 路径规则。
需要注意:
- 主流搜索引擎与正规 SEO 工具爬虫通常会遵守该协议
- 恶意采集脚本、违规抓取器不一定遵守
抓取和索引的区别
robots.txt:控制抓取,也就是爬虫能不能下载页面源码noindex:控制索引,也就是页面会不会出现在搜索结果里
如果你希望页面彻底不出现在搜索结果中,通常需要配合页面 meta robots noindex 或 HTTP 响应头中的 X-Robots-Tag: noindex,不能只依赖 robots.txt。
本地运算说明
本工具的配置解析、语法校验、文本生成都在浏览器本地完成,不会把你的域名、规则内容、Sitemap 地址上传到服务器。
二、顶部导航栏功能逐项释义
首页 / 全部工具 / 编程开发
首页:返回 Gotokit 首页,查看全站工具入口全部工具:查看所有免费在线工具,包括格式化、生成、加密、图片、PDF 等类型编程开发:当前工具所属分类,主要集中提供站长、前端、后端开发辅助工具
三、页面主模块分层详解
模块 1:开始使用区域
- 标题:
🤖 robots.txt 在线生成器 - 辅助说明:Gotokit 工具无需下载、无需登录、可直接在线使用
这部分的作用是让用户明确知道:本工具没有使用次数限制、无需注册、没有付费门槛,打开页面即可直接配置、复制、下载文件。
模块 2:模板快速套用
模板区用于一键加载预设规则,减少手工配置成本。
1)通用网站模板
适用场景:
- 企业官网
- 资讯站
- 内容站
默认思路:
- 允许主流搜索引擎抓取
- 屏蔽常见后台、临时、私密目录,如
/admin/、/private/、/tmp/ - 预留 Sitemap 填写位置
2)静态博客 / 工具站模板
适用场景:
- Astro
- VitePress
- Hugo
- 在线工具站
默认思路:
- 放行图片与视频类爬虫
- 屏蔽草稿目录
/draft/ - 屏蔽预览页面
/preview/ - 屏蔽内部接口
/api/internal/ - 不主动拦截公开静态资源
/assets/
3)电商网站模板
适用场景:
- 独立站
- 跨境电商
- 商城站点
默认思路:
- 屏蔽购物车、结算页、用户中心、筛选参数页
- 允许商品公开页面抓取
- 尽量减少重复参数页面对 SEO 的干扰
- 预留兼容商品、分类等多 Sitemap 的写法
4)完全屏蔽模板
适用场景:
- 测试站
- 内部演示站
- 未上线站点
默认思路:
User-agent: *
Disallow: /
这表示禁止所有爬虫抓取整个站点。只建议临时使用,不适合长期挂在正式网站上。
模块 3:站点基础配置区
这里有两个核心输入项:网站域名 与 Sitemap 地址。
1)网站域名
功能:
- 用于辅助标准化 URL
- 用于自动补全 Sitemap 完整地址
- 不会直接写入最终
robots.txt正文
填写建议:
- 尽量填写完整地址,例如
https://demo.com - 建议带上
https
2)Sitemap 地址
功能:
- 生成
Sitemap: 完整URL指令 - 主动告诉搜索引擎你的站点地图位置
填写规范:
- 使用完整绝对地址,如
https://demo.com/sitemap.xml - 如果有多条 Sitemap,可换行分别填写
- 不填写时,工具不会输出
Sitemap:指令,但不影响基础规则生成
模块 4:快捷开关
允许所有爬虫
会自动生成接近下面的全局规则:
User-agent: *
Disallow:
这里 Disallow 留空,表示默认允许全站抓取。之后你仍然可以继续补充具体的黑名单路径。
禁止所有爬虫
会自动生成:
User-agent: *
Disallow: /
表示全站默认拒绝抓取。之后如果你需要单独放行某些爬虫,可以继续在下方新建规则组覆盖。
模块 5:实时预览操作按钮组
复制代码
把当前预览区中的完整 robots.txt 文本复制到剪贴板,方便你直接粘贴到服务器根目录中新建文件。
下载 robots.txt
浏览器本地导出标准命名的 robots.txt 文件,无需手动重命名。
重置
清空表单配置、清空预览文本、重置校验状态,回到初始状态,方便重新生成一套新规则。
模块 6:语法校验提示栏
这个模块会实时提示当前配置是否可靠。
配置有效
表示当前未检测到明显问题,例如:
- 没有重复
User-agent - 没有明显的路径冲突
SitemapURL 格式正确
常见异常场景
重复爬虫组:同一个User-agent被多次定义路径语法错误:路径没有以/开头,或格式不标准Sitemap 格式错误:只写了相对路径,或缺少http/https规则冲突:同一爬虫组里同时出现上级Disallow与下级Allow
一般情况下,Allow 对更具体路径的优先级会高于上级 Disallow,但仍建议人工复核。
模块 7:编辑模式切换
可视化编辑
推荐新手使用。你只需要:
- 勾选爬虫
- 选择规则类型
- 输入路径
系统会自动生成对应文本,并同步到预览区。
纯文本模式
适合熟悉 robots.txt 语法的用户。你可以直接手写完整规则文本,系统会在可能的范围内解析并同步回表单。
这在以下场景特别有用:
- 批量复杂规则
- 特殊自定义爬虫
- 希望手工精细控制文本结构
模块 8:爬虫与路径规则核心配置区
8.1 基础说明
每一个规则组只作用于当前组已选中的 User-agent。
你可以创建多个组,让不同爬虫拥有不同的抓取规则。
例如:
- 组 1:给全部爬虫统一屏蔽
/admin/ - 组 2:只给
AhrefsBot额外屏蔽更多目录
8.2 添加爬虫组 / 复制组
添加爬虫组:
- 新建一组独立规则
- 不同组之间互不干扰
复制组:
- 一键复制当前组的已选爬虫与路径规则
- 适合在相似规则基础上快速改少量内容
8.3 预设爬虫勾选面板
全部爬虫 (*)
- 对应:
User-agent: * - 作用:通配所有主流搜索引擎爬虫、SEO 工具爬虫以及部分 AI 爬虫
- 适合放在第一组,写全站通用规则
Googlebot
- Google 网页主爬虫
- 负责抓取网页正文内容
- 海外站点通常建议允许
Googlebot-Image
- Google 图片抓取爬虫
- 负责图片搜索索引
- 图库、图文博客通常建议允许
Googlebot-Video
- Google 视频抓取爬虫
- 负责视频页与视频资源抓取
- 没有视频内容的网站可以不必单独放行
Bingbot
- Microsoft Bing 搜索引擎主爬虫
- 对海外流量和国内必应搜索都有效
DuckDuckBot
- DuckDuckGo 搜索爬虫
- 更偏向海外隐私搜索流量
AhrefsBot
- Ahrefs SEO 工具爬虫
- 常用于外链、页面、SEO 数据分析
- 如果服务器压力较大,很多站点会选择屏蔽
SemrushBot
- Semrush SEO 竞争分析工具爬虫
- 常用于关键词与排名监控
- 服务器资源有限时也常被屏蔽
YandexBot
- Yandex 搜索引擎爬虫
- 面向俄语区、东欧市场的网站通常建议允许
Baiduspider
- 百度搜索主爬虫
- 面向中文站、国内流量时通常建议允许
8.4 自定义 User-agent
如果预设列表里没有你要的爬虫,可以手动添加,例如:
ApplebotGPTBotCCBotfacebookexternalhit
常见含义:
Applebot:苹果 Siri / Spotlight 检索相关爬虫GPTBot:OpenAI 相关抓取标识,部分站点会选择屏蔽CCBot:Common Crawl 抓取器
8.5 路径规则配置面板
Allow:
- 表示允许当前组选中的爬虫抓取指定路径
- 常用于“父目录屏蔽、子目录单独放行”的情况
Disallow:
- 表示禁止当前组选中的爬虫抓取该路径
路径填写规范:
- 必须以
/开头 - 可以写目录,也可以写单页面
例如:
/admin//private.html
点击 添加规则 后,本条路径规则会保存到当前组中。一个组里可以有多条 Allow / Disallow。
8.6 快捷路径一键追加
/assets/
- 通常是图片、CSS、JS、字体等静态资源目录
- 大多数公开网站会允许抓取
/admin/
- 后台管理目录
- 往往包含敏感配置与登录入口
- 通常建议禁止抓取
/preview/
- 预览页、草稿预览页
- 一般没有 SEO 价值
/tmp/
- 临时缓存或临时上传目录
- 内容不稳定,通常不建议抓取
/api/internal/
- 内部接口目录
- 面向系统调用,不面向搜索引擎
/search/draft/
- 草稿、未发布稿件目录
- 通常建议禁止抓取
/private/
- 会员私密内容、内部文档或隐私页面目录
- 通常建议禁止抓取
四、推荐使用流程
- 先选择最接近网站类型的模板
- 填写网站域名与 Sitemap 地址
- 使用快捷开关决定默认开放还是默认屏蔽
- 在规则组中勾选爬虫并添加路径规则
- 查看实时预览是否符合预期
- 查看语法校验是否存在错误或警告
- 复制或下载
robots.txt并部署到网站根目录
五、使用提醒
- 生成的
robots.txt内容本身不随页面语言变化 - 所有生成与校验都在浏览器本地完成
robots.txt管的是抓取,不等于一定禁止索引
最后更新:2026-08-01
常见问题
什么是 robots.txt?
robots.txt 是放在网站根目录下的文本文件,用来告诉搜索引擎爬虫哪些路径可以抓取,哪些路径不建议抓取。
如何测试 robots.txt 是否生效?
部署后先直接访问 /robots.txt,确认浏览器能打开;再结合 Search Console、Bing Webmaster Tools 或日志观察抓取情况。
robots.txt 会不会阻止页面被索引?
不一定。robots.txt 主要控制抓取,不等于 noindex。某些页面即使被阻止抓取,仍可能因为外部链接而出现在搜索结果中。
Astro 静态站点如何部署 robots.txt?
将生成好的 robots.txt 放到最终站点根目录即可。对 Astro 静态站点来说,确保构建产物部署后可以通过 https://你的域名/robots.txt 直接访问。
robots.txt 和 noindex 有什么区别?
robots.txt 控制“是否抓取”,noindex 控制“是否建立索引”。如果你的目标是不让页面出现在搜索结果里,通常需要用 noindex,而不是只靠 robots.txt。
Cloudflare 环境下需要注意 robots.txt 缓存吗?
需要。更新 robots.txt 后,若 Cloudflare 或浏览器缓存未刷新,搜索引擎可能暂时看到旧版本。修改后建议主动清缓存并再次访问 /robots.txt 验证。
更多编程开发
编程开发全部工具Token/安全密码生成器
本地运行的安全密码生成工具,支持长度、字符集、高级排除规则与强度评估。
GotoKit在线哈希生成器
GotoKit在线哈希生成器 — 输入文本或拖拽文件,一键生成MD5/SHA1/SHA256/SHA384/SHA512五种哈希值。实时更新、HMAC模式、大小写切换、一键复制。纯浏览器本地计算。
MD5在线加密工具 - 密码生成与哈希比对
在线MD5加密工具,支持文本MD5生成、安全密码生成器(含MD5哈希)、MD5哈希比对三种模式。纯浏览器本地计算,数据不上传。
JSON 格式化器 & 验证器
基于 vanilla-jsoneditor 的在线 JSON 格式化、压缩、复制、下载、自动修复与验证工具,简洁且支持高级模式。
在线 YAML ↔ JSON 相互转换工具
免费在线 YAML 与 JSON 互转工具,粘贴即可双向转换,支持语法校验、复制、下载和清空。适用于配置文件(Docker/K8s/CI/CD)、API 文档和数据交换。
在线 XML 格式化 / 压缩 / 校验工具
免费在线 XML 格式化、压缩与校验工具。粘贴 XML 即可美化排版、压缩体积或实时语法校验,支持可配置缩进、属性排序和空元素折叠。所有处理在浏览器本地完成。
URL 在线编码解码工具
免费在线 URL 编码解码工具 — 支持批量处理、encodeURI / encodeURIComponent 双模式、空格处理(%20 / +)、智能识别编码状态。一键去除跟踪参数、内置编码对照表和代码示例。纯浏览器本地运算,数据不上传。
XML Sitemap 在线生成器
免费在线 XML Sitemap 生成工具,粘贴 URL 列表即可生成标准 sitemap.xml,支持 lastmod/changefreq/priority 批量设置、URL 去重校验、CSV/TSV/旧 sitemap 提取,超过 5 万条自动生成 sitemapindex 分卷。纯前端本地运行。
正则表达式测试器
在线正则表达式测试工具,支持实时匹配、高亮显示、语法解释和测试用例管理。
Cron 表达式生成器 - 在线定时任务表达式解析工具
在线 Cron 表达式生成器和解析器。可视化构建定时任务表达式,支持人类可读翻译和下次执行时间预览,内置 6 个常用模板。