Evidently AI

Evidently AI

开源的 AI 评估与可观测性框架Evidently AI 帮助团队评估、测试和监控 LLM、RAG 应用、AI agents 与机器学习模型,让 AI 系统在每次更新后保持安全、可靠并适合生产环境。

Evidently AI 页面快照
7500+
GitHub stars
40m+
下载量
3000+
社区成员
100+
内置评估指标
核心能力

覆盖 AI 质量全流程

从测试用例生成、自动化评估到持续监控,在统一框架中跟踪 AI 输出质量、数据质量、模型表现和潜在风险。

LLM 评估与测试

评估聊天机器人、RAG 应用、AI agents、副驾驶及其他 LLM 产品的质量与安全性。

自动化评估

系统化衡量 AI 输出质量、安全性和可靠性,并将评估集成到流水线中,通过可分享的可视化报告查看结果。

合成数据生成

生成贴合具体场景的真实、边界或对抗性输入,覆盖普通提示与恶意攻击等测试需求。

持续监控

通过实时仪表板持续跟踪评估结果和质量检查,及时发现数据漂移、回归问题与新出现的风险。

预测性机器学习监控

使用内置指标评估和监控模型预测表现、数据漂移与数据质量。

学习资源

了解 AI 质量与 MLOps

通过官方指南、基准数据集和课程,学习 LLM 评估、AI 可观测性与机器学习系统设计。

LLM-as-a-Judge:使用大语言模型进行评估的完整指南

官方指南介绍如何使用 LLM-as-a-Judge 开展评估。

LLM 基准与数据集

提供 250 个 LLM 基准和数据集,支持模型评估与测试工作。

AI 评估与可观测性课程

提供面向 AI builders 的 LLM 评估和 AI 可观测性课程及实践内容。

官方资源

从文档到实践案例

查阅官方文档、教程、指南、基准数据集和社区资源,开始构建适合自身场景的 AI 质量体系。

Evidently AI

从这里开始使用Evidently AI。