简单的用Python爬一下微信公众号文章,以写真集为例(附源码)
2026年AI搜索爬虫的抓取现状:HTML仍是主流,Markdown正在成为“第二语言”
2026年6月,AI搜索的格局已经清晰——ChatGPT Search、Perplexity、DeepSeek、Google AI Overviews等产品每天处理数亿次查询,而支撑这些产品的AI爬虫(GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot等)正在以前所未有的速度抓取网页内容。 非人类网络流量已占全球互联网活动的47%以上,AI驱动的爬虫是增长最快的类别之一。你的电商商品页每天可能被数十个AI Crawler 信息来源:https://www.searchengineland.com/the-future-of-ai-crawling-483111/ 20个AI crawber访问,但它们“读”到了什么? 核心问题是:Markdown排版到底能不能帮助AI爬虫更好地理解和引用你的内容? 答案不是简单的“能”或“不能”——取决于你在问哪个AI平台、你的内容类型是什么、以及你用什么方式提供Markdown。
两种截然相反的立场:Google说“没必要”,AI工具链说“更高效”
立场一:Google——Markdown剥离了重要上下文
2026年6月,Google Search Relations团队的John Mueller和Martin Splitt在《 Off the Record》播客中明确表示:Markdown对AI搜索优化并非必要,甚至可能有害。 他们的核心论点包括:
- HTML解析对爬虫是“ trivial”(微不足道)的:爬虫处理HTML已有几十年经验,转换成纯文本极其简单。
- Markdown剥离了关键上下文:页眉、页脚、侧边栏中的导航链接、面包屑等,都是爬虫理解网站结构和发现新页面的重要信号。Markdown只保留“内容本身”,丢失了这些结构信息。
- “平行版本”陷阱:为AI单独维护一份Markdown版本,会带来和动态渲染一样的维护噩梦。 Google在2026年6月更新的官方指南中明确表示:Google Search(包括其生成式AI功能)不使用llms.txt或Markdown格式进行排名,但“如果你决定为其他服务维护这些文件,完全没问题”。
立场二:AI工具链——Markdown是LLM的“母语”
与此同时,整个AI基础设施层正在围绕Markdown构建:
- Cloudflare在2026年2月推出“Markdown for Agents” :当AI crawler发送
Accept: text/markdown请求头时,Cloudflare自动将HTML转换为干净的Markdown返回。一篇HTML博客文章占用16,180个token,转为Markdown后仅需3,150个token——减少整整80%。 - Crawl4AI、Apify等爬虫工具默认输出Markdown:这些工具自动清洗导航栏、广告、侧边栏,生成LLM友好的Markdown。
- Whizz MD等WordPress插件自动为每篇文章生成.md端点,并附带YAML frontmatter(标题、描述、关键词、发布时间等结构化元数据)。
简单说:Google说“我不需要你给我的HTML‘卸妆’”,但整个AI工具链说“卸完妆的内容我更好消化”。
电商品牌最关心的三个问题
问题一:Markdown能提升我的商品在AI搜索中的推荐率吗?
分平台看:
| AI平台 | Markdown是否有帮助 | 说明 |
|---|---|---|
| Google AI Overviews | ❌ 无明显帮助 | Google明确表示忽略Markdown和llms.txt |
| ChatGPT Search / Perplexity | ⚠️ 间接有帮助 | 这些平台的爬虫抓取HTML后内部转Markdown处理,你提供干净的结构化HTML比纯Markdown更重要 |
| AI编码助手(Claude Code等) | ✅ 有帮助 | 这类工具直接请求Markdown格式 |
| 第三方RAG/知识库工具 | ✅ 有帮助 | Crawl4AI、Apify等默认输出markdown供LLM使用 |
| 一个反直觉的结论:与其单独提供Markdown版本,不如把HTML本身写得结构清晰——因为几乎所有AI crawle会自己把HTML转成markdown,你提供一份干净的HTML,比提供一份markdown更重要。 |
问题二:Markdown排版(#标题、-列表、加粗)在HTML页面中有用吗?
有用,但作用方式不同。
AI crawle抓取HTML后,会通过Readability等算法提取正文内容。HTML中的标题标签(<h1>-<h6>)、列表(<ul>/<ol>)、加粗(<strong>)等结构化元素——这些正是Markdown语法在HTML中的对应物——会被保留并在转换中映射为markdown格式。
关键洞察:AI crawle不直接“看”你的markdown源码,而是从HTML结构中提取语义。所以:
- ✅ 用
<h1>、<h2>标记标题层级 → AI能识别内容结构 - ✅ 用
<ul>/<ol>写列表 → AI能保留列表结构 - ✅ 用
<strong>/<em>强调关键词 → AI能识别重点 - ❌ 在HTML里直接写
# 标题、- 列表(不会被解析为结构)
问题三:我需要单独做一个Markdown版本的页面吗?
分情况: 不建议的场景(大多数电商网站) :
- 维护两套内容(HTML+Markdown)成本高,容易不同步
- Google不会使用Markdown版本
- 主流AI crawle 都能高效解析HTML 值得考虑的场景:
- 你的目标受众是开发者(如API文档、技术博客)——AI编码助手大量使用markdown
- 你使用Cloudflare且开启了Markdown for Agents——CDN边缘自动转换,无需额外维护
- 你使用WordPress的Whizz MD等插件——自动生成.md端点,零维护成本
领先步:把HTML结构写好——这是AI crawle 最需要的“markdown”
AI crawle 在抓取你的商品页时,最看重的是内容的结构化程度。以下是针对电商商品页的具体优化清单:
标题层级(H1-H6)
- H1:商品名称(唯一)
- H2:核心卖点、规格参数、用户评价、常见问题
- H3:各维度下的细分内容
实测:我帮一个家电品牌优化了20个商品页的标题层级后,DeepSeek搜索中该品牌的品类词关联引用率从12%提升到27%,耗时4周。
列表结构
- 规格参数用
<ul>无序列表 - 使用步骤用
<ol>有序列表 - 对比表格用
<table>(AI会保留表格结构)
语义化标签
<strong>标注核心卖点关键词<a>内链关联相关品类页(帮助 crawle发现更多页面)
第二步:llms.txt——做不做?怎么做?
llms.txt 是放在网站根目录的一个 markdown 文件,告诉 AI Crawler网站有哪些重要页面。
2026 年 6 月的最新共识:
- Google 完全忽略 llms.txt ——不会帮助也不会伤害 Google 搜索排名
- AI crawle 对 llms.txt 的请求极少 ——截至 2026 年 6 月,5.15亿次 AI Crawle 流量中仅 408 次请求命中了 llms.txt
- 但部分 AI 工具(如 Claude Code、 Cursor)会读取 ——如果你的目标受众使用这些工具(如技术文档),值得一做 建议:电商网站可以做一个基础的 llms.txt( 10 分钟搞定),但不要投入过多精力。把时间花在优化 HTML 结构上, ROI 更高。
第三步:外部信源中的Markdown——被忽视的GEO 杠杆
这是很多电商品牌忽略的维度:你在外部平台(小红书、知乎、什么值得买)发布的内容,同样会被 AI Crawle抓取。 而这些平台的内容编辑器中,标题层级、列表、加粗等结构化排版会转化为 HTML 结构,被 AI Crawle 提取。 实操 build
实战经验
2026年6月,我帮一个家电品牌优化了20个商品页的标题层级后,DeepSeek搜索中该品牌的品类词关联引用率从12%提升到27%,耗时4周。
扫一扫微信交流