由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

llm-evaluation

话题找到数量

langfuse/langfuse

🪢 开源LLM工程平台:LLM可观测性、指标评估、提示管理、游乐场、数据集。与OpenTelemetry、Langchain、OpenAI SDK、LiteLLM等工具集成。🍊YC W23

30k
3.2k
616
+94
排名 #7
7月9日
查看详情

mlflow/mlflow

构建AI/大语言模型应用的开源开发者平台,提供端到端追踪、可观测性与评估功能的一体化集成平台

26k
5.8k
725
+24
排名 #14
6月11日
查看详情

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

22k
2k
699
+41
排名 #17
6月17日
查看详情

comet-ml/opik

通过全面的追踪、自动化评估和生产就绪的仪表盘,调试、评估并监控您的LLM应用、RAG系统和智能体工作流。

21k
1.7k
661
+29
排名 #10
8月3日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
701
+22
排名 #10
5月16日
查看详情

NVIDIA/garak

大语言模型漏洞扫描器

7.7k
898
598
+12
排名 #5
4月25日
查看详情

Helicone/helicone

🧊 开源大语言模型可观测性平台。一行代码实现监控、评估与实验。YC W23 🍓

5.5k
543
425
+7
排名 #7
4月21日
查看详情

cyberark/FuzzyAI

一款用于自动化大语言模型模糊测试的强大工具。

1.4k
197
377
+1
排名 #11
5月17日
查看详情
助手