标签主题词 (Topic)

# web-scraping

探索包含 web-scraping 主题特性的所有开源仓库、扩展插件与智能体组件。

gosearch
BugraAkdemir

Zero-API-key Go library for web search (DuckDuckGo, Bing, Google, Yandex) with LLM-ready Markdown extraction

复用本地已登录Chrome实例,无需重复登录即可爬取需登录的网站,支持自动填写表单、模拟点击跳转页面,依托原生wc3_*工具实现操作,无反爬限制,使用体验流畅。

dsh-fetch-third-party
tallahandsome-ux

支持将网页抓取任务委托给用户配置的第三方服务执行,不直接访问目标URL从根源规避SSRF风险,API密钥托管在统一凭据存储,可按会话灵活调整配置。

fastCRW实现,为DeepSeek的ctx.web提供可替换默认的网络搜索与网页获取服务,支持网页检索、内容抓取,部署轻量,运行稳定,适配各类联网功能调用需求。

dsh-firecrawl
firecrawl

依托Firecrawl服务提供网页搜索、内容抓取能力,可作为Web能力模块的提供者,开箱即用,无需手动配置爬虫规则,快速获取公开网页的搜索结果与结构化页面内容。

dsh-webfetch
TYEclipse

可抓取任意网页链接,自动提取结构化Markdown、纯文本内容及全站链接清单,无任何运行时依赖,采用只读模式运行,输出内容干净无冗余,无需额外配置即可直接使用。

dsh-wigolo
tianjiqx

DSH 联网搜索私有化方案,代理 web_search/web_fetch 至 Wigolo,覆盖搜索/抓取/提取/深度研究/缓存/监控全链路,数据不出域,零查询成本。 Wigolo-powered DSH search plugin —...

deepspider
ma-pony

集成Patchright/CDP与独立语义运行时,从浏览器证据中自动恢复参数生成逻辑,交付可验证Solver,并支持AI原生爬虫与JavaScript逆向工程。

agent-skills
octoparse

汇集八爪鱼采集器常用代理技能,支持网页数据抓取、字段解析与任务调度,AI代理可直接调用,减少重复编码,快速构建自动化采集流程。

source-watch
whaojie797-design

通过 sources.yml 配置监控源,本地执行确定性变更检测,标记内容、标题、新增与消失差异,命中关注关键词时给出 HIGH 优先级提醒,让 agent 依赖的网页源变化一目了然。

dsh-read-url
2672243194

支持抓取任意网页并返回清洗后的正文或Markdown内容,自动适配GBK/GB2312/UTF-8/Big5等多种编码,自带6000字符上限、缓存与偏移机制降低token消耗,无额外依赖。