跳到主要内容

Context.dev把所有抓取接口合成一个:网页、PDF、Office文件一次搞定

9月23日 16:13

动察 Beating AI 快讯,YC S26 初创公司 Context.dev 推出 Scrape Anything,把原本分散的网页抓取 API 合并成一个接口。开发者只需要提供一个网页或在线文件 URL,再选择想要的格式,就能一次拿到 Markdown、HTML、截图、页面图片、原始文件或结构化字段。


除了处理普通网页,它目前还支持 PDF、DOCX、PPT、XLSX 等约 40 种文件格式。JavaScript 渲染、代理切换、反爬处理和重试都由 Context.dev 负责,开发者不用自己维护浏览器和代理基础设施。此前这些能力已经存在,这次主要是把不同输入和输出统一到同一个 /v1/web/scrape 接口。


一次普通抓取消耗 1 个 credit,请求多个输出格式仍共用这一次基础计费;使用浏览器操作则为 2 个 credits,PDF OCR 另按恢复页数计费。

来源