很多外贸站收录差,根因不是内容不行,而是搜索引擎根本“进不来”或“走错门”。XML 站点地图与 robots.txt 就是站点和爬虫之间的“门牌与告示牌”:一个告诉蜘蛛有哪些页面值得抓,一个规定哪些区域禁止进入。本文讲清两者的区别、写法规范与常见误操作,让你把技术地基打牢,避免上线后一个月收录惨淡,也避免因为一条错指令毁掉整站努力。
一、XML 与 HTML 站点地图不是一回事
两者名字相似但用途不同,千万别混用:
- XML 站点地图:写给搜索引擎看的机器文件,列出网址、更新时间与优先级,通常位于 /sitemap.xml,需提交到 GSC 才会被高效读取。
- HTML 站点地图:写给用户看的导航页,帮助访客快速找到栏目,对 SEO 是辅助而非核心,不能替代 XML 版。
外贸站应优先做好 XML 版,并按产品、文章、语言拆分成多个文件,再用一个 sitemap 索引文件聚合,避免单文件超过 5 万网址或 50 MB 上限。动态站可用插件自动生成并每日更新,确保新上架产品第一时间被收录。
二、robots.txt 指令怎么写

robots.txt 放在根目录,用纯文本控制抓取。最常用几条指令:
- User-agent:指定规则面向哪个爬虫,如 Googlebot,用星号表示全部爬虫。
- Disallow:声明禁止抓取的路径,如后台 /admin/、购物车 /cart/、测试环境。
- Allow:在禁止目录下放行特定文件,优先级高于同目录的 Disallow。
- Sitemap:直接写出 sitemap 地址,方便爬虫一进根目录就拿到入口。
示例:禁止抓取后台但放行 sitemap,并显式声明地图位置。注意 robots 是“建议”而非“强制”,敏感内容仍需靠密码或 noindex 保护,别指望一条 Disallow 能守住隐私。
三、千万别误屏蔽 CSS 与 JS

这是新手最高频的致命错误。早年有人为了“省抓取预算”把整个 js 或 css 目录 Disallow,结果 Google 渲染不出页面、读不到动态内容,排名直接暴跌。现代渲染依赖 CSS 与 JS 判断布局与内容,正确做法是放行样式与脚本目录,只屏蔽真正无意义的后台、测试与重复参数页。改完用 GSC 的“网址检查”或“富媒体搜索结果测试”验证渲染是否正常,确认页面结构被正确读取,再放心上线。
四、提交搜索引擎:让配置生效
写好 sitemap 后,除了在 robots.txt 里声明,还要到 GSC 的“站点地图”面板主动提交;Bing 则在 Bing Webmaster Tools 提交。上线或大幅改版后,第一时间重新提交能加快新结构被识别。robots 修改后可用“抓取方式”或“网址检查”测试,确认目标路径的放行或屏蔽符合预期,避免一条错指令毁掉整站收录,也避免把重要栏目误关在门外。
还有两个易踩的坑值得强调:一是 sitemap 里不要塞已经 noindex 或已被 robots 屏蔽的网址,否则等于自相矛盾,浪费抓取预算;二是改版换域名时,旧站 robots 千万别急着全屏蔽,应先靠 301 把权重迁到新站,等收录切换完成再逐步收紧。把地图与告示牌配好,爬虫才能高效、准确地把你的页面送进索引库,外贸站的流量基石才算真正夯实。

站点地图与 robots.txt 是 SEO 的“基础设施”,出错代价极高但修正成本极低。上线前花十分钟核对一遍,胜过上线后一个月收录惨淡。



