备份与归档

看到一篇好文章,怎么把它完整存成 Markdown(不只是复制粘贴)

公众号、知乎、掘金、CSDN、小红书和普通网页复制后格式混乱时,怎样保留标题、代码、表格和图片并得到可长期使用的 Markdown。

8 分钟8 min read 发布于 2026/10/6Published 2026/10/6 更新于 2026/10/6Updated 2026/10/6
本页结构 On This Page

复制一篇文章进笔记软件,常见结果是标题变正文、代码块散掉、表格错行,图片还带着原站防盗链。页面能看,不等于内容已经整理好。

剪贴板保存的是文字外观,Markdown 保存的是内容结构。中间缺少转换,文章很快会变成无法搜索和迁移的杂文本。

复制粘贴通常丢什么

  • 标题层级全部变成正文。
  • 列表缩进、引用和代码语言信息消失。
  • 表格被拆成一堆制表符或空格。
  • 图片仍然是原平台链接,换环境后裂图。
  • 推荐卡片、广告和自动加载内容混进正文。

如果只是临时阅读,复制粘贴够用;如果要把文章变成素材库,就应该在导出时把结构固定下来。

不同平台的麻烦点不一样

平台常见问题
公众号图片防盗链,正文里有推荐卡片
知乎回答区动态加载,折叠内容需要展开
掘金 / 少数派代码块较多,需要保留语言标记
CSDN / 简书广告、推荐位和正文容易混在一起
小红书图文混排,以图片为主要内容
X 等社交平台动态加载,线程需要按顺序整理

没有一种“复制规则”能同时处理所有平台。平台适配的价值在于先识别正文范围,再清理无关模块。

三种保存方式

平台自带的 Markdown 入口

部分平台提供 /markdown、纯文本或导出接口。它适合有官方入口的平台,但通常只处理部分内容,图片仍可能是外链。

命令行或脚本工具

开发者可以用脚本抓取正文、处理 Cookie 和图片,再生成 Markdown。它灵活,但不适合普通用户长期使用。

浏览器扩展直接转换页面

扩展在你当前打开的页面里识别正文,把标题、列表、代码块、表格和图片链接转成 Markdown。飞书工具箱对常用内容平台做了清理适配,其他网页走通用提取。

网页转 Markdown 免费。图片较多、需要把图片打包到本地时,可以使用 Pro 的图片 ZIP。

图片是最容易留下隐患的部分

远程图片链接可能在很短的时间内失效,也可能要求原站 Referer 或登录状态。如果文章要长期保存,应该把图片下载到本地,并改写成相对路径。

推荐目录:

article.md
assets/
  001-cover.jpg
  002-chart.png

按正文顺序命名,比保留一堆哈希文件名更容易重新对应。

导出后怎么检查

  1. 看 H1 到 H3 是否按原层级出现。
  2. 复制一段代码,确认代码格式和语言标记。
  3. 检查表格列数是否一致。
  4. 移动整个文件夹,确认图片仍然存在。
  5. 搜索文章中间的关键词,确认没有只导出了前半段。

存成 Markdown 之后能做什么

Markdown 比富文本更适合进 Git、笔记软件和 AI 上下文。结构清楚、体积小,也更容易做全文搜索和批量处理。

但不要为了“喂给 AI”就丢失来源信息。建议在开头保留原文标题、作者、发布日期和来源链接,方便以后核实。

哪些文章不应该保存

付费内容、仅限会员阅读的内容和明确禁止下载的材料,不要因为浏览器能打开就批量导出。复制限制和访问权限是两件事,扩展不负责绕过权限。

只保存以后还会回看的文章,并保证它们能搜索、能移动。资料库的质量比抓取数量重要。