公开 URL 内容抓取
@ BruceL0171432026.7.14url-to-markdown
通过 Chrome 抓取公开网页,并把渲染后的内容保存为经过核实的 Markdown 或 JSON。
官方精选文档知识
基础信息
- 名字/名称
- 公开 URL 内容抓取
- 描述说明
- 抓取无需登录的公开 URL,保存为 Markdown 或 JSON;适用于 X、YouTube 字幕和 Hacker News。Do NOT trigger when 页面需登录、验证码或人工操作。
公开 URL 内容抓取
把无需登录和人工操作的公开网页保存为本地 Markdown 或 JSON,并核实实际内容。
什么时候用它
保存公开网页
我有一个无需登录即可打开的 HTTP 或 HTTPS 页面,希望保存渲染后的主要内容,并按需下载媒体文件。
提取视频字幕
我需要公开 YouTube 视频的字幕,或匿名可访问的 X 帖子与线程内容。
抓取公开讨论
我想把 Hacker News 讨论或其他公开页面保存为 Markdown 或结构化 JSON,供后续使用。
不接
它不处理需要登录、验证码、付费或人工操作的页面,也不会摘要、改写、翻译或发布抓取内容。
它会产出什么
命令成功仍只是暂定结果,必须检查保存后的标题和正文。
- 内容文件:按域名和页面分组,以不会冲突的路径保存干净 Markdown 或 JSON
- 媒体文件:可按设置下载图片与视频,并把链接改为本地路径
- 抓取报告:返回输出路径、所用适配方式、媒体结果和未经核实的限制
- 偏好设置:首次使用且没有
EXTEND.md时,先询问保存位置和媒体处理方式 - 浏览器动作:通过内置命令使用 Chrome,也可复用用户明确提供的 CDP 地址
- 绝不会做:导出登录状态、要求用户绕过访问限制,或把登录页当成成功结果保存
前置条件与边界
前置条件
需要一个公开的 HTTP 或 HTTPS 地址。环境需要 Bun、Chrome 或 Chromium、可写的输出位置;首次运行还需要完成偏好选择。
相邻能力分工
- 原样保存一个公开页面 → url-to-markdown
- 跨多个来源调研并核实主张 → collect-sources
不接的场景
- 登录墙、验证码、Cloudflare 验证或任何人工交互
- 多个含义不清的地址,或强制使用不受支持的适配方式
- 对抓取页面做摘要、编辑、翻译或发布
容易混淆的边界
- 已适配 X、YouTube、Hacker News 和普通公开网页
- 媒体处理优先看明确参数,其次是保存的偏好,最后才是默认值
- 即使命令成功,低质量内容也会被删除并报告为不受支持
版本信息
当前快照最新更新时间2026.7.14
本地 Skill catalog 公开快照,仅展示公开安全字段。
Skill 文件
(52)SKILL.md
SKILL.md · Markdown