首页 / 产品 / ThinSpider
多租户云采集引擎

ThinSpider任意平台的任意数据,一个任务 DSL 全部拿下

静态页、列表详情、SPA 动态渲染与 API 接口,四类数据源共用一套任务模型;控制台分步向导或 Firecrawl 风格 REST 接口双通道提交,租户隔离队列与弹性 worker 池稳定执行,结果 JSON / CSV / Webhook 直出,可沉淀至 ThinkData 与 ThinKM。统一身份一次登录跨产品通行,支持内网私有化出包。

thinspider.thinkalike.com.cn / 采集控制台
4类数据源
2提交通道
3结果出口

一套引擎,覆盖四类数据源

声明任务、提交执行、字段抽取、结果交付,端到端打通

四类采集形态

静态页与列表-详情站点直接解析;SPA 走浏览器池等渲染完成再取正文;纯数据接口按字段采集,一个任务模型覆盖。

任务 DSL 一处声明

用一份 JSON 描述入口地址、遍历范围、抓取深度与目标字段;业务同学在控制台向导里点出来,工程师可直接手写提交。

Firecrawl 风格 REST

/v1/scrape 抓单页、/v1/crawl 遍历站点、/v1/map 找链接、/v1/tasks/{id} 查进度,接口形态对齐主流采集服务,便于替换式接入。

清洗去重与字段抽取

URL 归一化后按内容哈希去重,避免同页多入口重复入库;字段抽取支持显式规则与模型辅助,异常时按选择器降级保稳定。

多租户隔离 · 弹性池

每个租户独立队列与轮转公平调度,慢任务不挤占他人额度;worker 池可水平扩展,业务数据各存独立库,边界清晰。

统一登录 · 私有化出包

以统一身份中心为 IdP,授权码 + PKCE 换取令牌并离线验签,跨产品一次登录通行;同一内核可内网出包,按实例授权激活。

从入口 URL 到干净的结构化字段

任务提交后,引擎自行发现链接、归一化去重、按需渲染,再把正文与自定义字段抽成可检索的结构化数据。

  • 链接发现:按入口页与深度范围展开遍历,边抓边归一化去重。
  • 按需渲染:静态页直接解析,SPA 等渲染完成后再取内容。
  • 字段落地:标题、正文、时间与自定义字段结构化,直供 ThinkData/ThinKM。
任务执行 · 队列 / worker 池
发现链接
抽取字段

控制台向导,或一套 /v1 接口

同一份任务 DSL 两条通道:业务同学在控制台分步向导里点出来,工程师直接 POST /v1/crawl 集成进自己的系统,无需再学一套私有协议。

  • 标准接口:/v1/scrape · /v1/crawl · /v1/map · /v1/tasks/{id} · /v1/webhooks。
  • 状态一致:任务进度、条目计数与失败原因在控制台与接口两侧同源。
  • 结果直出:JSON / CSV 下载,或由 Webhook 回调推送到下游。
POST /v1/crawl · 任务提交
任务 DSL
结果
4类
数据源形态
2通道
向导与 REST
3出口
JSON/CSV/Webhook
1次
登录跨产品

从登录到取结果的四步

统一登录、声明任务、引擎执行、结果直出

1

统一登录

跳转统一身份中心,一次登录拿身份令牌,跨产品通行。

2

定义任务

控制台分步向导或 POST /v1/crawl,声明入口、范围与目标字段。

3

引擎执行

任务进入租户队列,隔离 worker 池按需渲染抓取并去重。

4

结果直出

JSON / CSV 导出或 Webhook 回调,可沉淀至 ThinkData/ThinKM。

适用场景

内容聚合行业资讯采集竞品与公开数据采集SPA 站点采集列表-详情批量遍历知识库语料准备

ThinSpider 面向公开可访问的数据采集,不承诺无条件突破任何站点;请遵守目标站点的访问规则与相关法律法规。

产品界面一览

把任意平台的数据变成可用输入

体验 ThinSpider 的四类采集形态、任务 DSL 与多租户隔离引擎。

立即试用 ThinSpider

关于 ThinSpider 的常见问题

ThinSpider 是什么?

英同科技 ThinkAlike 出品的多租户云采集引擎:静态页、列表详情、SPA 动态渲染与 API 接口四类数据源,用一份任务 DSL 声明,控制台向导或 REST 接口提交,结果以 JSON / CSV / Webhook 交付。

接口和 Firecrawl 是什么关系?

采用 Firecrawl 风格的接口命名与请求体形态(/v1/scrape、/v1/crawl、/v1/map、/v1/tasks/{id}、/v1/webhooks),便于替换式接入现有工程;具体字段以产品的 /v1 接口文档为准。

支持定时抓取吗?

本期以任务提交与队列执行为主,任务里的调度字段仅作登记、暂不自动触发。需要周期采集时,可由外部定时任务按计划调用 /v1/crawl 提交。

能采集任意站点吗?

不承诺无条件突破任何站点。ThinSpider 面向公开可访问的数据采集,需遵守目标站点的访问规则与相关法律法规,并按租户配额并发执行。

采集结果怎么进知识库?

结果可 JSON / CSV 导出,或由 Webhook 回调直推你自己的系统,再沉淀至 ThinkData 与 ThinKM 供检索与问答。

如何私有化部署?

SaaS 与内网出包为同一内核。私有实例经 SN 授权文件(Ed25519 验签 + AES-256-GCM 内容加密)激活,未激活时只读、敏感写入受限。