# ThinSpider｜面向工程师的多租户云采集引擎

> ThinSpider 是英同科技 ThinkAlike 出品的多租户云采集引擎：静态页、列表详情、SPA 动态渲染与 API 接口四类数据源共用一套任务 DSL；控制台分步向导或 Firecrawl 风格 REST API 双通道提交，租户隔离队列与弹性 worker 池稳定执行，结果 JSON / CSV / Webhook 直出，经统一身份一次登录跨产品通行，支持内网私有化出包。

- 产品: ThinSpider / ThinSpider / ThinSpider
- 品牌: ThinkAlike (北京英同科技有限公司)
- 在线试用: https://thinspider.thinkalike.com.cn
- 落地页: https://thinkalike.com.cn/thinspider.html

## 核心能力
- **四类采集形态** — 静态页与列表-详情站点直接解析，SPA 走浏览器池等渲染完成再取内容，纯数据接口按字段采集，一个任务模型覆盖。
- **任务 DSL 一处声明** — 一份 JSON 描述入口地址、遍历范围、抓取深度与目标字段；控制台向导生成，也可手写提交。
- **Firecrawl 风格 REST** — /v1/scrape 抓单页、/v1/crawl 遍历站点、/v1/map 找链接、/v1/tasks/{id} 查进度，便于替换式接入现有工程。
- **清洗去重与字段抽取** — URL 归一化后按内容哈希去重；字段抽取支持显式规则与模型辅助，异常时按选择器降级保稳定。
- **多租户隔离 · 弹性池** — 每租户独立队列与轮转公平调度，慢任务不挤占他人额度；worker 池可水平扩展，业务数据各存独立库。
- **统一登录 · 私有化出包** — 授权码 + PKCE 换取令牌并离线验签，跨产品一次登录通行；同一内核可内网出包，按实例授权激活。

## 产品亮点
### 从入口 URL 到干净的结构化字段
任务提交后引擎自行发现链接、归一化去重、按需渲染，再把正文与自定义字段抽成可检索的结构化数据，直接供给 ThinkData/ThinKM。

### 控制台向导，或一套 /v1 接口
同一份任务 DSL 两条通道：业务同学在控制台分步向导里点出来，工程师直接 POST /v1/crawl 集成进自己的系统；任务进度、条目计数与失败原因在两侧同源。

## 适用场景
内容聚合 · 行业资讯采集 · 竞品与公开数据采集 · SPA 站点采集 · 列表-详情批量遍历 · 知识库语料准备

ThinSpider 面向公开可访问的数据采集，不承诺无条件突破任何站点；请遵守目标站点的访问规则与相关法律法规。

## 常见问题
**ThinSpider 是什么？**

英同科技 ThinkAlike 出品的<b>多租户云采集引擎</b>：静态页、列表详情、SPA 动态渲染与 API 接口四类数据源，用一份<b>任务 DSL</b> 声明，控制台或 REST 接口提交，结果以 JSON / CSV / Webhook 交付。

**接口和 Firecrawl 是什么关系？**

采用 <b>Firecrawl 风格</b>的接口命名与请求体形态（/v1/scrape、/v1/crawl、/v1/map、/v1/tasks/{id}、/v1/webhooks），便于替换式接入；具体字段以产品的 /v1 接口文档为准。

**支持定时抓取吗？**

本期以<b>任务提交与队列执行</b>为主，任务里的调度字段仅作登记、暂不自动触发；需要周期采集时可由外部定时任务调用 /v1/crawl 提交。

**能采集任意站点吗？**

<b>不承诺无条件突破任何站点。</b>ThinSpider 面向公开可访问的数据采集，需遵守目标站点访问规则与相关法律法规，并按租户配额并发执行。

**采集结果怎么进知识库？**

结果可 <b>JSON / CSV 导出</b>或由 <b>Webhook 回调</b>直推你自己的系统，再沉淀至 <b>ThinkData</b> 与 <b>ThinKM</b> 供检索与问答。

**如何私有化部署？**

SaaS 与内网出包为<b>同一内核</b>。私有实例经 <b>SN 授权文件</b>（Ed25519 验签 + AES-256-GCM 内容加密）激活，未激活时只读、敏感写入受限。
