小红书 · 图文 + 视频
小红书笔记提取:
图文 OCR 和视频逐字稿
一条链接进去,出来的是正文、标签、每张图的描述与图上的字、视频的逐字稿和要点。 不需要登录,不需要 cookie,两种分享域名都支持。
264 字的真相
服务器请求到的笔记长这样
一条真实笔记,服务器端请求,去掉 script 之后整个 DOM 只剩 264 个字符。 这就是任何「读取网页」工具拿到的全部:
<!doctype html> <html><head><title>小红书</title></head> <body><div id="app"></div></body></html> # 没有正文。没有图。没有字。
正文在图片里,视频没有字幕。yt-dlp 只能读视频笔记的视频流,而图文笔记是小红书的大多数。 所以要的不是「更好的 HTML 解析」,是把每张图读一遍。
分享链接
两种域名都支持
xhslink.cn · xhslink.com
iOS App 复制出来的是 xhslink.cn/o/…,桌面和老分享是 xhslink.com/o/…。两种都会解析到 xiaohongshu.com/discovery/item/… 或 /explore/…。只认一种的工具会静默降级——这里有实测记录。
不需要登录 / cookie
小红书按 User-Agent 返回不同页面:移动 UA 拿到「下载 App」的壳,桌面 UA 拿到真数据; 冷请求会被拒,先访问 /explore 建立会话再读笔记就行。全程没有账号, 所以没有你的账号会被封,也不用给我们任何东西。
实测
图文笔记和视频笔记各一条
图文笔记,17 张图
17 张图逐一描述并 OCR,得到 381 段屏幕文字、13 个要点,用时 119 秒。 首页的回放就是这一条,逐字可查。
视频笔记
ASR 逐字稿(带时间戳)加抽帧 OCR,得到 56 段屏幕文字、12 个要点, 约 160 秒。转写用 SenseVoice,中文上明显优于 Whisper 一类模型。
返回字段
拿到什么
| 字段 | 内容 |
|---|---|
| caption | 笔记正文和话题标签 |
| images[].description | 每张图的描述 |
| images[].ocr | 每张图上的文字(OCR) |
| ocr_text | 所有屏幕文字,按出现顺序 |
| transcript | 视频笔记的逐字稿,{ t, text },t 是秒 |
| key_points | 要点,保持原文语言 |
| author / title / posted_at | 作者、标题、发布日期 |
| degraded | 哪一步没有完整读到;空数组表示干净 |
用法
一条真实的请求
带 xsec_token 的分享链接原样贴进去即可。
curl -X POST https://linkdigest.dev/api/v1/digest \
-H "Authorization: Bearer ld_live_..." \
-H "Content-Type: application/json" \
-d '{"url": "https://www.xiaohongshu.com/discovery/item/6a6bf662000000002402de7e?xsec_token=CBCe01s1uyd2C8uMx6ycYcnEwPV5_31OX1u_I19FCSd54=&xsec_source=app_share", "format": "json"}'这条链接是首页示例之一,已经被读过并缓存,所以会直接返回 200, 不扣额度。换成你自己的链接:图文和短帖直接返回;需要下载并转写的视频返回 202 和一个 jobId,用同一个 key 去 GET /api/v1/digest/JOB_ID 取结果。
MCP · Claude Code / Cursor
claude mcp add --transport http linkdigest \ https://linkdigest.dev/mcp \ --header "Authorization: Bearer ld_live_..."
| 平台 / 类型 | 原因 |
|---|---|
| B站(哔哩哔哩) | 对我们服务器的地址直接返回 HTTP 412,请求到不了视频。需要代理,目前没有。 |
| X 长文(Articles) | 只能拿到首图。普通帖子的图片、视频都能读,长文正文读不到。 |
| 代码已接入,但没有端到端验证过,所以不算支持。 |
价格
按工作量计费,不按链接数
dev
$9/月
每月 500 个 credit(积分)。一条普通图文笔记 1 积分,约 $0.018; 视频每开始的 1 分钟 2 积分,一条 10 分钟的视频按公式是 21 积分,约 $0.38。
不计费的
任何人读过的链接再读都免费、不计额度。读不出内容的链接(没有逐字稿、没有屏幕文字、没有图片描述)不收费, 并在一小时内允许重试,而不是把一份空结果缓存一个月。注册有免费试用额度,不用绑卡,具体数字见定价页。
常见问题
会被问到的
- 小红书笔记提取需要登录或者 cookie 吗?
- 不需要。用桌面 User-Agent 先访问一次 /explore 建立会话,就能读到笔记数据,全程不用账号。你不用给我们任何 cookie,也没有你的账号会被封。
- App 里复制出来的 xhslink.cn 链接能用吗?
- 能。iOS App 复制的是 xhslink.cn,桌面和老分享是 xhslink.com,两种都会解析到 xiaohongshu.com 的笔记页。分享链接带的 xsec_token 原样贴即可。
- 图文笔记能提取图片里的字吗?
- 能,这是重点。每张图都会被描述一遍并做 OCR,一条 17 张图的笔记实测得到 381 段屏幕文字和 13 个要点,用时 119 秒。
- 视频笔记有逐字稿吗?
- 有。小红书不发布字幕,所以逐字稿来自 ASR(SenseVoice),带时间戳;同时对抽帧做 OCR。一条视频笔记实测得到 56 段屏幕文字和 12 个要点,约 160 秒。
- 读不出来会怎样?
- 结果里有一个 degraded 字段,用人话写明哪一步没读到。读不出内容的链接不收费。
先免费试,不用绑卡。支持的平台上有链接读不出来,就是一个值得报告的 bug。