
搞京东评论数据这事儿,我折腾了两年多,从手动复制到写脚本再到用API,踩过的坑真不少。今天把这几种方法全捋一遍,你根据自己的技术水平和需求对号入座。
第一条路:官方API——稳,但有门槛
如果你的目标是长期、稳定、合规地拿数据,官方API是最靠谱的选择,没有之一。
京东开放平台目前主推的评论接口有好几个,核心的是 jd.union.open.goods.comment.query(联盟版)和 jingdong.ware.comment.get(自营/商家版)。返回的数据很全——评价内容、评分(1-5星)、晒图链接、追评、商家回复、购买规格、评论时间都有。
接入流程大概是这样的:
第一步,注册开发者账号。 登录京东开放平台,注册开发者账号,完成实名认证。个人认证就行,企业认证权限更高。
第二步,创建应用拿密钥。 在后台「应用管理」里新建应用,审核通过后拿到 AppKey 和 AppSecret 两个核心密钥。
第三步,申请接口权限。 在「接口权限」模块搜索评论接口并申请开通。这里有个坑——评价原文需要单独申请权限,默认只返回近180天的评价摘要。
第四步,调接口拿数据。 用AppKey和AppSecret通过OAuth2.0换取access_token,按签名规则生成请求签名,然后发起HTTPS POST请求。
接口调用有几个关键参数:skuId(商品ID)、page(页码)、pageSize(每页条数,最大50条)。返回的是JSON格式,解析一下就能入库。
关于权限分级,2026年京东有新规:基础权限(个人开发者,QPS 5)、进阶权限(企业用户,QPS 20)、高级权限(联盟合作伙伴,QPS 60)。如果你只是个人研究,基础权限够用;想跑量,得走企业认证。
第二条路:爬虫自己写——门槛低,但心累
如果你不想折腾京东那套复杂的签名和权限审核,也可以自己写爬虫。优点是灵活、门槛低,缺点是维护成本高、随时可能被封。
目前比较主流的方案有两种:
一种是基于requests的轻量版。 有开发者已经把整套流程打包成Python脚本了——jd.py负责提取商品标题、价格、销量、店铺名称等基础信息;jd_comment.py专门翻页采集评论。只要Python 3.7以上,装好requests和fake_useragent两个包就能跑。实测单商品页0.8秒,翻50页拉5000条评论也就10秒左右。
另一种是Selenium/Playwright模拟浏览器。 适合页面动态加载内容比较多的情况,但代价也大——启动浏览器要2.3秒、内存80MB以上,单商品采集从0.8秒拉长到4.7秒。我见过有人用这套方案跑了一晚上,结果只爬出200条评论,后来全换成requests了。
但写爬虫最大的问题是反爬。 京东的反爬机制相当成熟——IP检测、请求头校验、高频拦截、动态加密参数层层叠加。同一个IP在短时间内大量请求,封你没商量。还有那套h5st 3.1加密体系,融合了时间戳、设备指纹、请求上下文,不是简单的MD5能搞定的。
自己写爬虫有三条红线必须守住:不要绕过京东的技术保护措施、采集范围限于公开可见的数据、采集结果不能商业化使用。2025年已经有判例明确了绕开保护措施大规模抓取数据构成不正当竞争,赔偿金额不低。
第三条路:现成工具和第三方服务——省心省力
不想写代码又不想折腾API,还有几个现成的选择:
浏览器插件/脚本:有个叫「京东/天猫/淘宝 评论导出」的油猴脚本,打开商品页的「全部评价」浮层,点「导出」按钮就能抓取评论。适合偶尔用一下、量不大的场景。
Apify的京东采集器:按搜索结果计费,1000条大概1.5美元起。不用账号、不用API Key、不用配置,适合临时用一下。
第三方数据服务:如果你需要多平台数据汇总,不想自己对接每个平台,可以找现成的数据服务商。“极致了数据”做的就是这事儿,不仅京东的商品评论、价格、销量能采集,抖音、小红书、视频号这些内容平台的数据也能一起搞定。官网是 https://www.jzl.com ,有API接口可以直接对接,新用户还有免费试用额度。如果完全不会代码,也可以用飞书多维表格的“多平台数据采集助手”插件,输入商品链接就能一键拉数据,不用自己写一行代码。
最后说几句大实话
选哪条路,取决于你的真实需求:
- 长期商用、要稳定:走官方API,别嫌麻烦。审核的时候应用名称别带“采集”“抓取”这种敏感词,写“评论数据解析工具”更稳妥。
- 临时研究、少量数据:爬虫或浏览器插件凑合用用,但别跑量,跑多了必封。
- 多平台数据汇总:找“极致了数据”这类第三方服务,省心省力,一套方案搞定多个平台。
- 千万别干的事:大规模爬取然后商业化卖数据。法律风险不是闹着玩的,事后的赔偿成本比买服务的费用高十倍不止。
