伯纳斯-李视为典范的URL仅四个月便消失了
伯纳斯-李视为典范的URL仅四个月就消失了,但他那篇文章本身却在同一个地址上存活了28年。本文梳理了链接失效的根源及其在AI时代的意义。
AI与科技四个月就死去的链接,活了28年的文章
1998年,蒂姆·伯纳斯-李写了一篇题为“Cool URIs don’t change”的短文。翻译过来大概是“好的URI不会改变”。这篇短文近乎万维网发明者写给网站管理员们的一通唠叨,其中的核心句子是这一句:
“URI1不会改变。改变它的只有人。”
他在文中挑选并展示了几个好地址的示例。其中之一是美国杂志《Money》的一篇报道地址,伯纳斯-李甚至还在旁边加上了“看起来不错”的评语。然而,承载该地址的网站 pathfinder.com 却在1999年4月被时代华纳全盘撤下。距他将其指为典范仅仅过了四个多月。
读者,而伯纳斯-李自己的那篇文章,至今依然能在1998年发布时的原地址正常打开。整整28年了。
被视为典范的地址仅四个月便消失无踪,而指出这一点的文章却完好地留存至今。链接消失的原因不在于技术,而在于由谁决定继续维护这个地址。而这个由来已久的问题,在2026年突然重新变得至关重要。因为随着阅读万维网的主体从人类转向机器,链接的角色已经从“通路”变成了“证据”。
万维网的消失速度远超想象
我们先来看看它消失的速度有多快。皮尤研究中心在 2024 年发布的一项调查,是该领域最值得引用的实测数据。该研究从 Common Crawl2 数据中按年份各抽取约 90 万个页面,对 2013 年至 2023 年进行了追踪。
结果显示:**截至 2023 年 10 月,2013 年存在的网页中有 38% 已无法访问。**这意味着十年过去,超过三分之一的网页已经消失。甚至连 2023 年创建的网页,也有 8% 已经无法打开。这还不到一年时间。
更引人注目的是维基百科。在对 5 万篇维基百科词条进行调查后发现,54% 的词条包含至少一个失效的参考文献链接。这意味着,当我们核实信息时最先打开的页面中,有一半以上已经失去了部分立论依据。
法庭上的情况更为严重。哈佛法学院乔纳森·齐特林(Jonathan Zittrain)与劳伦斯·莱斯格(Lawrence Lessig)团队在 2014 年发表的一项研究显示,**1996 年至 2011 年间美国联邦最高法院判决书中引用的 URL 中,约 50% 已不再包含原始内容。**而在《哈佛法律评论》(Harvard Law Review)论文中引用的链接情况更糟,原文完好保留的仅有 26.8%。
这里该研究区分的两个概念非常关键。“链接失效”(link rot)是指点击网址时报错的情况;而“引用漂移”(reference rot)3则是指网址能够正常打开,但内容已经被篡改或变更的情况。研究团队发现,后一种情况要普遍得多。也就是说,相比打不开的链接,能打开但内容已发生改变的链接数量更多。这为何如此危险,稍后我会进一步详述。
需要指出的是,这些数据全部来自以美国为中心的样本。我目前尚未见过用相同方法测算韩语网络流失率的公开资料。不过,回想一下 Naver 博客与 Cafe 的部分服务关停、Daum View 或 me2day 等整体消失的平台,以及各大媒体机构的新闻数据库改版,韩国这边的情况恐怕很难更乐观。
伯纳斯-李的诊断:这不是技术问题,而是组织问题
现在让我们回到1998年的那篇文章。伯纳斯-李的独到之处在于,他并未将这一问题视为技术缺陷。
他把管理员们找的借口一一记下并逐加反驳:“网站改版了”、“不得不迁移文件”、“那个文件现在不是约翰管了,改由简负责”、“以前用CGI脚本,现在改用二进制程序了”。紧接着他反问道:当初为什么要把约翰的名字放进网址里?
他的药方可以概括为一句话:设计网址,在很大程度上是在决定“不把什么放进去”。
他建议剔除的清单如下:作者姓名(人会离职)、主题分类(分类体系总在变动)、文档状态(诸如draft、latest、old之类)、访问权限划分(团队专属、会员专属、公开)、文件扩展名(连.html总有一天也会变)、软件痕迹(cgi-bin、.pl),甚至还包括磁盘名称。实际上唯一可以保留的,只有发布日期。因为日期绝不会改变。
重读这份清单,你会发现一个共同点:那些被要求剔除的项目,全都是组织的内部情况。谁在负责、归属于哪个部门、处于什么阶段、使用何种技术栈。网址失效并不是因为服务器出了故障,而是因为组织把自身的内部结构刻进了暴露在外的名字里。组织一旦变动,名字也随之瓦解。
我更愿意把这称为“网址是组织架构图的化石”。浏览某家公司的URL结构,大致就能看出他们在哪个年份做过什么团队重组。比如/2019/newbiz/、/ai-innovation/、/dx-center/这样的路径。而一旦那个团队不复存在,相应的路径也会一同消失。
伯纳斯-李甚至将这上升到道德义务的高度。“设定一个在2年后、20年后、甚至200年后都能坚守的网址,是网站管理员的义务。”即使以1998年的标准来看,这话听起来也略显夸张,但在今天看来,这番话甚至还显得有些保守了。
随着AI开始阅读网络,链接的角色发生了改变
在过去的28年里,失效链接主要只是一种不便。点击后弹出404固然令人烦躁,但大不了重新搜索一下就好。然而现在情况不同了。如今的结构变成了:人类不再亲自搜索,而是向AI提问;AI读取网络内容生成答案,并在下方附上来源。在这种结构中,链接不再是“跳转路径”,而是作为“证明此话属实的证据”而存在。
然而,这项证据并不能很好地发挥作用。
《哥伦比亚新闻评论》旗下的托中心(Tow Center)于2025年3月发布过一项调查。他们从20家新闻媒体的报道中截取片段,向8款聊天机器人询问其出处。在总计1600次提问中,结果是:超过60%给出了错误答案。 Grok 3的错误率高达94%,在其作为引用给出的200个链接中,有154个(77%)指向了错误页面。Gemini和Grok 3的回答中,有超过半数包含了不存在或已失效的URL。
在这项调查中,给我留下最深印象的反而是另一个方面:付费高级模型的错误率反而更高。 它们在不知道的时候不会承认自己不知道,而是自信满满地给出错误答案。正因为附带了来源链接,看起来甚至显得更可靠,可一点进去才发现根本是没有内容的页面。
前面提到的引用腐化在这里再次登场。如果链接因为404而失效,我们好歹还能察觉。问题在于网址依然有效、内容却已发生改变的情况。当AI把3年前学到的内容以当下的URL作为依据呈现出来时,人类只要不亲自点击那个链接去核实,就绝不可能发觉。而绝大多数人根本不会去点。
而且,网络也在从相反方向闭合
还有一个问题。如果说上面的情况是“机器错误解读网络”的问题,那么这一次则是“网络对机器关上大门”的问题。
Cloudflare 于 2025 年 7 月 1 日更改了政策。新注册的域名将默认拦截 AI 爬虫,只有在网站所有者允许的情况下才可访问。这是基础设施服务商首次将其设为默认选项。与此同时,他们还推出了对爬取行为计费的“Pay Per Crawl”。4
在这项决策的背后,Cloudflare 公开了一项指标:爬取引流比5,即 AI 公司需要抓取某个网站多少次,才会给该网站回馈一名访客。截至 2025 年 6 月第四周,Anthropic 的这一比例约为 70,900 比 1。相当于抓取 7 万次才引流 1 人。相反,Mistral 是 0.1 比 1,带来的引流人数比抓取次数多出十倍。各家公司之间的差距极为悬殊。
不过,解读这个数字时需要保持谨慎。正如 Cloudflare 自己指出的那样,来自应用的流量不带 Referer 请求头,因此基于网页的工具的比例可能会被放大。但大趋势是清晰的:从这项指标来看,绝大多数 AI 公司对网站的抓取次数,远多于它们为该网站回馈的访客数量。
那么,接下来会发生什么呢?网站纷纷闭门谢客。它们用 robots.txt6 拦截、设置付费墙,或者隐藏在登录页面之后。这是合乎情理的抉择。然而,这样一来,想要核实信息的人就陷入了困境。
- 人工亲自核实需要点击链接,但其中相当一部分链接已经失效
- 向 AI 提问能得到答案,但其中 60% 的出处是错误的
- 想去核实原文,却被爬虫拦截和付费墙挡在门外
三个方向上的验证路径都在消失。 这正是链接腐蚀在 2026 年重新变得至关重要的真正原因。
Oswarld视角
对于将这个问题仅仅视为“归档问题”的视角,我感到有些无奈。比如有人会觉得,只要互联网档案馆努力帮我们存下来不就行了吗?但归档只是一种事后补救手段,让你在页面已经消失后还能找回它。它根本无法阻止链接本身失效。
在做咨询的过程中,我旁观过几次网站改版项目,而讨论 URL 结构的时机几乎总是被排在最后。定好了品牌,确定了设计,选好了 CMS,然后开发人员才会跑来问:“重定向打算怎么做?”而到了那个阶段,信息架构往往已经按照新的组织架构全部重编完了。改版完成后的几个月里,网站访问量一旦下滑,大家又会归咎于内容质量。但事实上,这正是他们在改版过程中亲手斩断了过去积累的所有链接的结果。
在制定 GTM(走向市场)策略时,我常说一句话:“你现在起的名字,三年后的你必须承担后果。”产品名、定价方案名、功能名,还有 URL,全都在遵循同样的逻辑运作。你在命名中夹杂的当前背景信息越多,眼下解释起来固然越轻松,但日后必然会失效。/2024_最终_真的最终.pptx 和 /cgi-bin/browse.pl 在本质上犯了完全相同的错误。
然而,在 AI 时代,有一点发生了决定性的变化。过去,稳定的 URL 是 SEO 资产;而现在,它关乎AI 能否将该地址作为回答的事实依据进行引用。我认为,长期保持网址不变的组织,与每次改版都更换网址的组织之间,未来的差距将会拉得越来越大。只要链接持续有效,随着时间推移,引用量就会不断累积;而一旦引用形成了规模,该域名本身就会开始被视作可信的依据。
当然,这只是我个人的见解,目前能佐证这一点的公开数据尚不充分。长期追踪各大域名在 AI 回答中被引用频次的研究才刚刚起步。但我认为,提前朝着这个方向做好准备是十分有价值的。毕竟,维护一条重定向规则所需的成本几乎为零。
结语
总结起来是这样的:
- 万维网正在迅速消失。 2013 年的网页已有 38% 不复存在,维基百科词条中有 54% 包含失效的参考文献。
- 原因不在于技术,而在于组织。 如果在网址中刻入负责人、部门、技术栈等内部情况,组织一旦变动,命名也会随之瓦解。
- 随着 AI 开始阅读万维网,失效链接的代价变得更高了。 链接如今既是人类点击跳转的通道,也是 AI 回答引作依据的出处。然而 Tow 中心的调查显示,聊天机器人引用的出处有 60% 以上是错误的,与此同时,网络正在走向阻挡爬虫访问的方向。
我们当下力所能及的事情其实微小得出奇。下次如果遇到重构网站或文档体系的时候,在确定新地址之前,不妨先列出一份清单,看看现在的地址中有哪些是可以拿掉的:部门名称、负责人、状态、扩展名。仅仅剔除这些,它在下一次重构中存活下来的几率就会大幅提升。伯纳斯-李的原作至今仍在同一个地方(见下文参考资料),花 30 分钟就能读完。
💬 你是否有过因改版或迁移而彻底丢掉旧链接的经历?当时你最遗憾的是什么?欢迎在评论区分享。我会整理出一份链接维护检查清单,并在下一期中呈现。
📨 如果你身边有人正准备重构网站,请将这篇文章转发给他们。
参考资料与延伸阅读
核心来源
- Tim Berners-Lee, “Cool URIs don’t change”, W3C Style Guide, 1998. 查看原文 ··· 今天这篇通讯的出发点。它在同一个地址上存活了整整 28 年,这一事实本身就是对全文最好的论证。
- Athena Chapekis, Samuel Bestvater, Emma Remy, Gonzalo Rivero, “When Online Content Disappears”, Pew Research Center, 2024年5月17日. 查看报告 ··· 谈论链接腐败时最值得引用的扎实实测数据。建议连同方法论章节一起阅读。
- Jonathan Zittrain, Kendra Albert, Lawrence Lessig, “Perma: Scoping and Addressing the Problem of Link and Reference Rot in Legal Citations”, Harvard Law Review Forum, Vol. 127, 2014. 查看论文 ··· 区分“链接腐败”与“引用腐败”的奠基之作。今天文章中最核心的概念便出自这里。
- Klaudia Jaźwińska, Aisvarya Chandrasekar, “AI Search Has a Citation Problem”, Columbia Journalism Review / Tow Center, 2025年3月6日. 查看调查 ··· 针对 8 种聊天机器人在 1,600 个测试案例下的对比调查。各工具的错误率对照表尤其值得一看。
- Cloudflare, “The crawl before the fall… of referrals”, Cloudflare Blog, 2025年7月1日. 查看分析 ··· 梳理了抓取回流比的概念以及各家公司的具体数值。正文中也坦诚指出了其测量局限。
背景知识
- Cloudflare, “Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large”, 2025年7月1日. 查看新闻稿 ··· 默认拦截 AI 爬虫这一转变的原始公告。我认为这是一份将被载入史册的文档,标志着网络访问规则的转折点。
- “Pathfinder (website)”, Wikipedia. 查看词条 ··· 伯纳斯-李曾视作模范的那个网站的最终结局。它于 1999 年 4 月关闭。
- Perma.cc,哈佛法学院图书馆创新实验室。 访问服务 ··· 上述论文提出的解决方案落地为实际服务的案例。这是少数将问题意识真正转化为基础设施的范例,非常值得参考。
📝 术语说明
注释
-
URI(统一资源标识符):网络上用于指示资源的地址体系。我们常说的 URL 只是 URI 的一种。伯纳斯-李之所以使用 URI 这一表述,意在强调“指向什么”比“在哪里”更为重要。 ↩
-
Common Crawl:定期抓取整个网络并免费公开的非营利性档案馆。它也常被用作大语言模型训练数据的起点。 ↩
-
引用腐败(reference rot):链接能够正常打开,但其中的内容已不再是原本引用的模样。由于不会报错,往往很难被察觉,因此比链接腐败更加棘手。 ↩
-
按抓取付费(Pay Per Crawl):Cloudflare 提供的一项功能,允许网站所有者对 AI 爬虫的访问进行计费。它用明码标价取代了非封即允的二元对立。 ↩
-
抓取回流比(crawl-to-refer ratio):衡量 AI 服务需要抓取某个网站多少次,才会将一位访客导流回该网站的比率。数值越大,意味着它“拿走得越多,回馈得越少”。 ↩
-
robots.txt:放置在网站根目录下的文本文件,用于声明哪些爬虫可以访问哪些内容的一种行业惯例。它没有法律强制力,本质上更接近依赖爬虫自觉遵守的君子协定。 ↩
