由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

evaluation-framework

话题找到数量

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

24k
2.2k
1.1k
+48
排名 #16
8月6日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
1.3k
+22
排名 #10
5月16日
查看详情

EleutherAI/lm-evaluation-harness

用于语言模型少样本评估的框架。

12k
3.3k
1.4k
+22
排名 #6
5月13日
查看详情

future-agi/future-agi

用于评估、观察和改进 LLM 和 AI 代理应用程序的开源端到端平台。追踪·评估·模拟·数据集·网关·护栏。可自行托管。阿帕奇2.0。

1.8k
544
360
+108
排名 #14
8月25日
查看详情

zeno-ml/zeno

AI数据管理与评估平台

214
11
689
排名 #14
6月29日
查看详情
助手