小红书 · 图文 + 视频

小红书笔记提取:
图文 OCR 和视频逐字稿

一条链接进去,出来的是正文、标签、每张图的描述与图上的字、视频的逐字稿和要点。 不需要登录,不需要 cookie,两种分享域名都支持。

264 字的真相

服务器请求到的笔记长这样

一条真实笔记,服务器端请求,去掉 script 之后整个 DOM 只剩 264 个字符。 这就是任何「读取网页」工具拿到的全部:

<!doctype html>
<html><head><title>小红书</title></head>
<body><div id="app"></div></body></html>

# 没有正文。没有图。没有字。

正文在图片里,视频没有字幕。yt-dlp 只能读视频笔记的视频流,而图文笔记是小红书的大多数。 所以要的不是「更好的 HTML 解析」,是把每张图读一遍。

分享链接

两种域名都支持

xhslink.cn · xhslink.com

iOS App 复制出来的是 xhslink.cn/o/…,桌面和老分享是 xhslink.com/o/…。两种都会解析到 xiaohongshu.com/discovery/item/… /explore/…。只认一种的工具会静默降级——这里有实测记录

不需要登录 / cookie

小红书按 User-Agent 返回不同页面:移动 UA 拿到「下载 App」的壳,桌面 UA 拿到真数据; 冷请求会被拒,先访问 /explore 建立会话再读笔记就行。全程没有账号, 所以没有你的账号会被封,也不用给我们任何东西。

实测

图文笔记和视频笔记各一条

图文笔记,17 张图

17 张图逐一描述并 OCR,得到 381 段屏幕文字13 个要点,用时 119 秒。 首页的回放就是这一条,逐字可查。

视频笔记

ASR 逐字稿(带时间戳)加抽帧 OCR,得到 56 段屏幕文字12 个要点, 约 160 秒。转写用 SenseVoice,中文上明显优于 Whisper 一类模型。

返回字段

拿到什么

字段内容
caption笔记正文和话题标签
images[].description每张图的描述
images[].ocr每张图上的文字(OCR)
ocr_text所有屏幕文字,按出现顺序
transcript视频笔记的逐字稿,{ t, text },t 是秒
key_points要点,保持原文语言
author / title / posted_at作者、标题、发布日期
degraded哪一步没有完整读到;空数组表示干净

用法

一条真实的请求

xsec_token 的分享链接原样贴进去即可。

curl -X POST https://linkdigest.dev/api/v1/digest \
  -H "Authorization: Bearer ld_live_..." \
  -H "Content-Type: application/json" \
  -d '{"url": "https://www.xiaohongshu.com/discovery/item/6a6bf662000000002402de7e?xsec_token=CBCe01s1uyd2C8uMx6ycYcnEwPV5_31OX1u_I19FCSd54=&xsec_source=app_share", "format": "json"}'

这条链接是首页示例之一,已经被读过并缓存,所以会直接返回 200, 不扣额度。换成你自己的链接:图文和短帖直接返回;需要下载并转写的视频返回 202 和一个 jobId,用同一个 key 去 GET /api/v1/digest/JOB_ID 取结果。

MCP · Claude Code / Cursor

claude mcp add --transport http linkdigest \
  https://linkdigest.dev/mcp \
  --header "Authorization: Bearer ld_live_..."

不支持的

先说做不到的

接进去之后才发现读不出来,比现在就知道更糟。以下是明确不支持的,写在这里也写在覆盖表上。

平台 / 类型原因
B站(哔哩哔哩)对我们服务器的地址直接返回 HTTP 412,请求到不了视频。需要代理,目前没有。
X 长文(Articles)只能拿到首图。普通帖子的图片、视频都能读,长文正文读不到。
Instagram代码已接入,但没有端到端验证过,所以不算支持。

价格

按工作量计费,不按链接数

dev

$9/月

每月 500 个 credit(积分)。一条普通图文笔记 1 积分,约 $0.018; 视频每开始的 1 分钟 2 积分,一条 10 分钟的视频按公式是 21 积分,约 $0.38

不计费的

任何人读过的链接再读都免费、不计额度。读不出内容的链接(没有逐字稿、没有屏幕文字、没有图片描述)不收费, 并在一小时内允许重试,而不是把一份空结果缓存一个月。注册有免费试用额度,不用绑卡,具体数字见定价页

常见问题

会被问到的

小红书笔记提取需要登录或者 cookie 吗?
不需要。用桌面 User-Agent 先访问一次 /explore 建立会话,就能读到笔记数据,全程不用账号。你不用给我们任何 cookie,也没有你的账号会被封。
App 里复制出来的 xhslink.cn 链接能用吗?
能。iOS App 复制的是 xhslink.cn,桌面和老分享是 xhslink.com,两种都会解析到 xiaohongshu.com 的笔记页。分享链接带的 xsec_token 原样贴即可。
图文笔记能提取图片里的字吗?
能,这是重点。每张图都会被描述一遍并做 OCR,一条 17 张图的笔记实测得到 381 段屏幕文字和 13 个要点,用时 119 秒。
视频笔记有逐字稿吗?
有。小红书不发布字幕,所以逐字稿来自 ASR(SenseVoice),带时间戳;同时对抽帧做 OCR。一条视频笔记实测得到 56 段屏幕文字和 12 个要点,约 160 秒。
读不出来会怎样?
结果里有一个 degraded 字段,用人话写明哪一步没读到。读不出内容的链接不收费。

先免费试,不用绑卡。支持的平台上有链接读不出来,就是一个值得报告的 bug。