面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。
Tag
rag-evaluation
包含该标签的简调共 2 篇。
面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。
Tag
包含该标签的简调共 2 篇。
面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。
面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。