声明任务、提交执行、字段抽取、结果交付,端到端打通
静态页与列表-详情站点直接解析;SPA 走浏览器池等渲染完成再取正文;纯数据接口按字段采集,一个任务模型覆盖。
用一份 JSON 描述入口地址、遍历范围、抓取深度与目标字段;业务同学在控制台向导里点出来,工程师可直接手写提交。
/v1/scrape 抓单页、/v1/crawl 遍历站点、/v1/map 找链接、/v1/tasks/{id} 查进度,接口形态对齐主流采集服务,便于替换式接入。
URL 归一化后按内容哈希去重,避免同页多入口重复入库;字段抽取支持显式规则与模型辅助,异常时按选择器降级保稳定。
每个租户独立队列与轮转公平调度,慢任务不挤占他人额度;worker 池可水平扩展,业务数据各存独立库,边界清晰。
以统一身份中心为 IdP,授权码 + PKCE 换取令牌并离线验签,跨产品一次登录通行;同一内核可内网出包,按实例授权激活。
任务提交后,引擎自行发现链接、归一化去重、按需渲染,再把正文与自定义字段抽成可检索的结构化数据。
同一份任务 DSL 两条通道:业务同学在控制台分步向导里点出来,工程师直接 POST /v1/crawl 集成进自己的系统,无需再学一套私有协议。
统一登录、声明任务、引擎执行、结果直出
跳转统一身份中心,一次登录拿身份令牌,跨产品通行。
控制台分步向导或 POST /v1/crawl,声明入口、范围与目标字段。
任务进入租户队列,隔离 worker 池按需渲染抓取并去重。
JSON / CSV 导出或 Webhook 回调,可沉淀至 ThinkData/ThinKM。
适用场景
ThinSpider 面向公开可访问的数据采集,不承诺无条件突破任何站点;请遵守目标站点的访问规则与相关法律法规。
英同科技 ThinkAlike 出品的多租户云采集引擎:静态页、列表详情、SPA 动态渲染与 API 接口四类数据源,用一份任务 DSL 声明,控制台向导或 REST 接口提交,结果以 JSON / CSV / Webhook 交付。
采用 Firecrawl 风格的接口命名与请求体形态(/v1/scrape、/v1/crawl、/v1/map、/v1/tasks/{id}、/v1/webhooks),便于替换式接入现有工程;具体字段以产品的 /v1 接口文档为准。
本期以任务提交与队列执行为主,任务里的调度字段仅作登记、暂不自动触发。需要周期采集时,可由外部定时任务按计划调用 /v1/crawl 提交。
不承诺无条件突破任何站点。ThinSpider 面向公开可访问的数据采集,需遵守目标站点的访问规则与相关法律法规,并按租户配额并发执行。
结果可 JSON / CSV 导出,或由 Webhook 回调直推你自己的系统,再沉淀至 ThinkData 与 ThinKM 供检索与问答。
SaaS 与内网出包为同一内核。私有实例经 SN 授权文件(Ed25519 验签 + AES-256-GCM 内容加密)激活,未激活时只读、敏感写入受限。