复制一篇文章进笔记软件,常见结果是标题变正文、代码块散掉、表格错行,图片还带着原站防盗链。页面能看,不等于内容已经整理好。
剪贴板保存的是文字外观,Markdown 保存的是内容结构。中间缺少转换,文章很快会变成无法搜索和迁移的杂文本。
复制粘贴通常丢什么
- 标题层级全部变成正文。
- 列表缩进、引用和代码语言信息消失。
- 表格被拆成一堆制表符或空格。
- 图片仍然是原平台链接,换环境后裂图。
- 推荐卡片、广告和自动加载内容混进正文。
如果只是临时阅读,复制粘贴够用;如果要把文章变成素材库,就应该在导出时把结构固定下来。
不同平台的麻烦点不一样
| 平台 | 常见问题 |
|---|---|
| 公众号 | 图片防盗链,正文里有推荐卡片 |
| 知乎 | 回答区动态加载,折叠内容需要展开 |
| 掘金 / 少数派 | 代码块较多,需要保留语言标记 |
| CSDN / 简书 | 广告、推荐位和正文容易混在一起 |
| 小红书 | 图文混排,以图片为主要内容 |
| X 等社交平台 | 动态加载,线程需要按顺序整理 |
没有一种“复制规则”能同时处理所有平台。平台适配的价值在于先识别正文范围,再清理无关模块。
三种保存方式
平台自带的 Markdown 入口
部分平台提供 /markdown、纯文本或导出接口。它适合有官方入口的平台,但通常只处理部分内容,图片仍可能是外链。
命令行或脚本工具
开发者可以用脚本抓取正文、处理 Cookie 和图片,再生成 Markdown。它灵活,但不适合普通用户长期使用。
浏览器扩展直接转换页面
扩展在你当前打开的页面里识别正文,把标题、列表、代码块、表格和图片链接转成 Markdown。飞书工具箱对常用内容平台做了清理适配,其他网页走通用提取。
网页转 Markdown 免费。图片较多、需要把图片打包到本地时,可以使用 Pro 的图片 ZIP。
图片是最容易留下隐患的部分
远程图片链接可能在很短的时间内失效,也可能要求原站 Referer 或登录状态。如果文章要长期保存,应该把图片下载到本地,并改写成相对路径。
推荐目录:
article.md
assets/
001-cover.jpg
002-chart.png
按正文顺序命名,比保留一堆哈希文件名更容易重新对应。
导出后怎么检查
- 看 H1 到 H3 是否按原层级出现。
- 复制一段代码,确认代码格式和语言标记。
- 检查表格列数是否一致。
- 移动整个文件夹,确认图片仍然存在。
- 搜索文章中间的关键词,确认没有只导出了前半段。
存成 Markdown 之后能做什么
Markdown 比富文本更适合进 Git、笔记软件和 AI 上下文。结构清楚、体积小,也更容易做全文搜索和批量处理。
但不要为了“喂给 AI”就丢失来源信息。建议在开头保留原文标题、作者、发布日期和来源链接,方便以后核实。
哪些文章不应该保存
付费内容、仅限会员阅读的内容和明确禁止下载的材料,不要因为浏览器能打开就批量导出。复制限制和访问权限是两件事,扩展不负责绕过权限。
只保存以后还会回看的文章,并保证它们能搜索、能移动。资料库的质量比抓取数量重要。