Skip to main content

公开 URL 内容抓取

@ BruceL0171432026.7.14url-to-markdown

通过 Chrome 抓取公开网页,并把渲染后的内容保存为经过核实的 Markdown 或 JSON。

官方精选文档知识

基础信息

名字/名称
公开 URL 内容抓取
描述说明
抓取无需登录的公开 URL,保存为 Markdown 或 JSON;适用于 X、YouTube 字幕和 Hacker News。Do NOT trigger when 页面需登录、验证码或人工操作。

公开 URL 内容抓取

把无需登录和人工操作的公开网页保存为本地 Markdown 或 JSON,并核实实际内容。

什么时候用它

保存公开网页

我有一个无需登录即可打开的 HTTP 或 HTTPS 页面,希望保存渲染后的主要内容,并按需下载媒体文件。

提取视频字幕

我需要公开 YouTube 视频的字幕,或匿名可访问的 X 帖子与线程内容。

抓取公开讨论

我想把 Hacker News 讨论或其他公开页面保存为 Markdown 或结构化 JSON,供后续使用。

不接

它不处理需要登录、验证码、付费或人工操作的页面,也不会摘要、改写、翻译或发布抓取内容。

它会产出什么

命令成功仍只是暂定结果,必须检查保存后的标题和正文。

  • 内容文件:按域名和页面分组,以不会冲突的路径保存干净 Markdown 或 JSON
  • 媒体文件:可按设置下载图片与视频,并把链接改为本地路径
  • 抓取报告:返回输出路径、所用适配方式、媒体结果和未经核实的限制
  • 偏好设置:首次使用且没有 EXTEND.md 时,先询问保存位置和媒体处理方式
  • 浏览器动作:通过内置命令使用 Chrome,也可复用用户明确提供的 CDP 地址
  • 绝不会做:导出登录状态、要求用户绕过访问限制,或把登录页当成成功结果保存

前置条件与边界

前置条件

需要一个公开的 HTTP 或 HTTPS 地址。环境需要 Bun、Chrome 或 Chromium、可写的输出位置;首次运行还需要完成偏好选择。

相邻能力分工

  • 原样保存一个公开页面 → url-to-markdown
  • 跨多个来源调研并核实主张 → collect-sources

不接的场景

  • 登录墙、验证码、Cloudflare 验证或任何人工交互
  • 多个含义不清的地址,或强制使用不受支持的适配方式
  • 对抓取页面做摘要、编辑、翻译或发布

容易混淆的边界

  • 已适配 X、YouTube、Hacker News 和普通公开网页
  • 媒体处理优先看明确参数,其次是保存的偏好,最后才是默认值
  • 即使命令成功,低质量内容也会被删除并报告为不受支持

一起来搞事情

关注我们的社交媒体,加入社群获取最新动态

微信交流群

扫码加入微信群

微信二维码