站点
393 个静态页面,/en/ 与 /zh/ 双语对照,内容来自 68 款胶卷 / 60 台相机的数据集,加上手写的指南与工具。
第一遍发现的问题
- 397 个 JSON-LD 块中有 43 个无效或缺失(工具页与档案页)。
- 1 个页面没有 meta description,还有若干重复的 description。
- 需要校验的内链 15152 条,以及外链 641 条。
- sitemap 指针是坏的:
robots.txt指向/sitemap.xml,而站点生成的其实是sitemap-index.xml。
只有爬虫能发现的问题
Cloudflare Pages 对**所有未知路径都返回 HTTP 200 + 首页内容**。/.env.production、/.git/config、/admin/login、任何拼错的地址,统统返回首页。这是典型的 soft 404:对搜索引擎是重复内容,对新域名是白白浪费抓取配额。
补上真正的 404.html 之后,这个修复**又暴露出第二个被 200 掩盖的 bug**:robots.txt 里的 sitemap 指针一直是错的,之前根本看不出来。
另外,www.openfilm.cc 一直能独立访问整套站点(host 级重定向规则从未生效),构成重复托管。
我们改了什么
- 为每个工具页、档案页、服务页生成 JSON-LD,并逐个校验全部 397 个块。
- 写了一个每次构建都会重跑的内外链检查脚本。
- 加入真正的 404 页面,并给布局加了
robots参数(让 404 可以 noindex)。 - 把
robots.txt指向sitemap-index.xml,并给/sitemap.xml加 301。 - 在 zone 上加了一条
www→ 顶域的 301 规则。 - 把 IndexNow 自动化:新页面发布后 30 分钟内自动提交给 Bing 与 Yandex。
验证
- 397/397 个 JSON-LD 块有效。
- 内链 15152 条,0 条失效(最后一次构建后的结果)。
- 641 条外链中 1 条真实 404,已定位并修复。
- sitemap 里 392 个 URL 全部返回 200(线上逐个实测)。
- 未知路径现在返回 404 并给出有用的导航页,而不是 200 的首页副本。
- Googlebot 确实在抓内容:24 小时窗口内 18 次
robots.txt、数十次文章页抓取,全部 200。
如果你请我们做
你会得到同一套流程:抓取你的站点、按优先级列出真正的问题、把修复写成你开发者可以直接照做的形式,并在改完后做第二遍验证每一项是否落地。固定价 150 USDC,5 个工作日交付。