AI observability 与 evals 平台,用于追踪生产 agent、运行系统化评测、捕捉质量回归,并把 prompt、数据集、scorers 和实验流程连接起来。
Tag
evals
包含该标签的简调共 3 篇。
开源 AI engineering / LLM observability 平台,把 traces、monitoring、datasets、experiments、evals 和 prompt 管理连接成一个持续改进循环。
面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。