由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

scraping

话题找到数量

firecrawl/firecrawl

面向AI的网页数据API——将整个网站转换为LLM就绪的Markdown或结构化数据🔥

157k
9k
745
+523
排名 #7
7月28日
查看详情

D4Vinci/Scrapling

🕷️ 一个自适应网络爬虫框架,能够处理从单个请求到大规模爬取的所有任务!

67k
6.7k
701
+280
排名 #11
6月30日
查看详情

scrapy/scrapy

Scrapy:Python 快速高级网页爬取与抓取框架

62k
11k
643
+53
排名 #14
6月23日
查看详情

huginn/huginn

创建可监控并代您执行的智能体。您的智能体随时待命!

49k
4.3k
585
+63
排名 #14
8月2日
查看详情

soxoj/maigret

🕵️‍♂️ 通过用户名从数千个网站收集个人档案

34k
2.6k
603
+52
排名 #14
7月1日
查看详情

JCodesMore/ai-website-cloner-template

使用AI编程代理,通过一条命令克隆任意网站

30k
4.4k
450
+7.2k
排名 #16
7月31日
查看详情

CloakHQ/CloakBrowser

一款能通过所有机器人检测测试的隐形Chromium浏览器。可直接替代Playwright,并附带源码级指纹补丁。30/30项测试全部通过。

28k
2.3k
568
+91
排名 #12
7月21日
查看详情

ScrapeGraphAI/Scrapegraph-ai

基于人工智能的Python爬虫工具

28k
2.8k
108
+26
排名 #10
7月30日
查看详情

apify/crawlee

Crawlee——一个用于构建可靠爬虫的Node.js网络爬取和浏览器自动化库。支持JavaScript与TypeScript。可为人工智能、大语言模型、检索增强生成或GPT提取数据。从网站下载HTML、PDF、JPG、PNG等文件。兼容Puppeteer、Playwright、Cheerio、JSDOM及原始HTTP请求。支持有头模式与无头模式。提供代理轮换功能。

24k
1.6k
645
+48
排名 #6
7月24日
查看详情

getmaxun/maxun

🔥 开源无代码网页抓取、爬虫、搜索与AI数据提取平台 • 数分钟内将网站转为结构化API 🔥

16k
1.4k
533
+88
排名 #12
7月1日
查看详情

MODSetter/SurfSense

NotebookLM/Perplexity开源替代方案,支持连接搜索引擎、Slack、Linear、Jira、ClickUp、Confluence、Notion、YouTube、GitHub、Discord等外部资源。加入Discord社区:https://discord.gg/ejRNvftDp9

15k
1.5k
504
+235
排名 #13
8月2日
查看详情

pystardust/ani-cli

用于浏览和播放动漫的命令行工具

13k
848
639
+688
排名 #7
7月31日
查看详情

yusufkaraaslan/Skill_Seekers

将文档网站、GitHub仓库和PDF文件转换为Claude AI技能,并具备自动冲突检测功能。

12k
1.2k
660
+158
排名 #5
4月3日
查看详情

daijro/camoufox

🦊 反检测浏览器

10k
891
523
+247
排名 #15
7月26日
查看详情

lorien/awesome-web-scraping

用于网络爬虫与数据处理的库、工具及API列表。

8k
914
500
+7
排名 #5
7月5日
查看详情

jo-inc/camofox-browser

为AI代理提供无头浏览器自动化服务器,用于访问通常被屏蔽的网站

7.8k
820
361
+29
排名 #12
7月18日
查看详情

tabulapdf/tabula

Tabula是一款用于从PDF文件中提取表格数据的工具

7.5k
697
552
排名 #11
7月29日
查看详情

firecrawl/firecrawl-mcp-server

🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 及其他 LLM 客户端添加强大的网络爬取功能

6.2k
699
533
+17
排名 #13
4月30日
查看详情

omkarcloud/botasaurus

构建无懈可击爬虫的全能框架

5.5k
479
257
+211
排名 #12
7月1日
查看详情

gosom/google-maps-scraper

从谷歌地图抓取数据。提取每个地点的名称、地址、电话号码、网站URL、评分、评论数量、经纬度、评论内容、电子邮件等信息。

5.4k
841
536
+785
排名 #12
7月31日
查看详情

KnockOutEZ/wigolo

您的AI编程代理首选网页——基于MCP的本地优先搜索、抓取、爬取与研究。无需API密钥,无需云端,零成本查询。公开测试版。

3.6k
246
249
+2k
排名 #17
7月26日
查看详情

jstrieb/github-stats

为您的个人资料提供更优质的GitHub统计图像,同时支持私有仓库的统计数据

3.5k
776
328
+4
排名 #8
8月4日
查看详情

any4ai/AnyCrawl

AnyCrawl 🚀:一款基于Node.js/TypeScript的爬虫工具,可将网站转化为适用于大语言模型的就绪数据,并能从谷歌、必应、百度等搜索引擎提取结构化搜索结果。原生支持多线程以进行批量处理。

3.4k
358
349
+86
排名 #8
7月12日
查看详情

Virtual-Browser/VirtualBrowser

免费反指纹浏览器,指纹浏览器,隐私浏览器,防识别浏览器,反识别浏览器,防关联浏览器,免费的 Web3 空投专用指纹浏览器 https://vbhub.net/?src=github

3k
480
544
+2
排名 #9
8月2日
查看详情
助手