数据评测安全

Ragas 简调

面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。

Ragas rag-evaluation llm-evaluation test-data-generation evals 面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。

Frontmatter

结构化元信息

实体类型
产品
主分类
数据评测安全
产品状态
已上线
开放状态
开源
产品形态
frameworklibrary
能力标签
evaluationtestingmonitoring
目标用户
开发者企业
交付方式
self-hosted
区域
us
模型策略
多模型混合
部署方式
自托管
技术披露
公开较多
是否实测
未测试
融资阶段
YC W24
信息截至
2026-07-30
最后复查
2026-07-30

Ragas

1. 调研缘由

RAG 和 agent 应用上线后,问题往往不只是“回答错了”,还包括检索上下文是否够准、回答是否忠于上下文、工具调用是否正确,以及一次改动有没有让旧场景退化。Ragas 切入的正是这类 LLM 应用评测问题:把原本靠感觉判断的质量检查,改成数据集、指标和实验循环。[S1][S2]

它不是一个托管型 observability 平台,而更像一套可以嵌入工程流程的开源评测库。它最早围绕 RAG 评测出名,后来文档和指标目录已经扩展到多轮对话、agent、工具调用、SQL、摘要和通用评分等场景。[S3][S4] 本篇主要回答:Ragas 适合解决哪一段评测问题;它和 LangSmith、Giskard、DeepEval 这类工具的边界在哪里;以及开源评测框架在生产环境里的上限是什么。

2. 简介与产品工作流

Ragas 官方把自己描述为帮助团队从“vibe checks”走向系统化 evaluation loops 的库,用来评估 LLM 应用并支持持续迭代。[S2] GitHub README 则把它概括为面向 LLM 应用的评测与优化工具,包含客观指标、测试数据生成、集成和反馈循环。[S5]

一个常见工作流可以拆成四步:

  1. 收集样本:团队准备真实或合成的查询、上下文、回答、参考答案、工具调用轨迹等数据。[S2][S5]
  2. 选择指标:按任务选择 faithfulness、context precision、context recall、response relevancy、tool call accuracy、factual correctness 等指标。[S3][S4]
  3. 运行实验:对不同检索器、提示词、模型、agent 配置或应用版本跑同一批评测,比较分数和退化点。[S2][S3]
  4. 形成反馈回路:把失败样本和生产数据继续加入测试集,用评测结果指导后续 prompt、检索和组件调整。[S5]

因此,Ragas 的核心不是替应用做追踪,也不是单独托管生产流量;它更偏向把 LLM 应用质量转成可复跑的实验和指标。

3. 团队与资本背景

Ragas 背后的公司是 Vibrant Labs。Y Combinator 页面显示,Vibrant Labs 成立于 2023 年,属于 YC Winter 2024,地点在 San Francisco,团队规模为 6 人,状态为 Active。[S6]

YC 页面列出两位创始人 Jithin James 和 Shahul ES。页面介绍中还写到,Jithin 负责软件和基础设施,曾在 BentoML 相关开源工具上工作;Shahul 负责 AI research 和 engineering,是 Kaggle Grandmaster,并参与过 Open-Assistant 等开源 AI 项目。[S6]

Ragas 的公开定位从一开始就带有开源基础设施色彩。YC Launch 文案称团队在构建面向 LLM 应用开发者的开源评测和测试基础设施,用 model-graded evaluations、自动合成测试数据、可解释指标和 adversarial testing 来帮助开发者更有信心地部署应用。[S6]

这次没有找到足够一手资料来核实公司收入、付费客户、定价或最新融资金额,因此本文不对商业规模做判断。

4. 技术基础与生态位

Ragas 的起点来自 RAG 评测。2023 年提交、2025 年修订的论文把 Ragas 描述为 reference-free 的 RAG pipeline 评测框架,目标是在不依赖人工 ground truth 标注的情况下,从检索上下文、回答忠实度和生成质量等多个维度评估 RAG 系统。[S7]

在当前产品文档里,Ragas 已经不只覆盖 RAG。指标目录包括 RAG 相关的 context precision、context recall、noise sensitivity、response relevancy、faithfulness,也包括 agent 和工具调用相关的 topic adherence、tool call accuracy、tool call F1、agent goal accuracy,以及 factual correctness、semantic similarity、SQL 和摘要等指标。[S4]

Ragas 把指标分成 LLM-based 和 non-LLM-based 两类。前者用 LLM 来打分,可能更接近人工判断,但有非确定性;后者不调用 LLM,结果更稳定,但与人工评价的相关性可能较低。[S3] 这说明它不是单一“自动打分器”,而是一套把不同评测机制组合进同一流程的工具。

它的生态位更接近“评测开发框架”,而不是完整生产管理平台。文档强调 experiments-first、dataset management、result tracking,以及与 LangChain、LlamaIndex 等框架集成。[S2] 同时,Ragas 也提供 LangSmith 集成,用来把 Ragas evaluation 的 traces 记录到 LangSmith 中。[S8]

5. 市场与外部信号

Ragas 的外部信号主要来自开源社区、框架集成和生态引用。GitHub README 显示项目提供 documentation、quick start、Discord、blog、newsletter 和 careers 等入口,并把 objective metrics、test data generation、framework integrations 和 feedback loops 放在核心卖点里。[S5]

LangChain 早在 2023 年就发布过 Ragas + LangSmith 的 RAG pipeline 评测教程,介绍如何用 Ragas 衡量 faithfulness、relevancy 和 recall,再用 LangSmith 运行和可视化评测。[S9] 这说明 Ragas 与 LangSmith 的关系并不是纯竞争,也可以是“指标库/评测框架 + 追踪平台”的组合。

从 YC 页面看,团队在 Launch 文案中声称 Ragas 已成为 RAG 应用评测的默认开源标准,并提到当时处理过大量 responses、被多家企业工程师使用。[S6] 这类表述来自项目方自述,本文只把它作为市场定位信号,不把它当作独立验证过的用户规模。

6. 公开评价与主要分歧

正面评价:

Ragas 的优势在于把 RAG 评测中常见的几个问题拆得比较细:检索是否找到了相关上下文、上下文排序是否合理、回答是否忠于上下文、回答本身是否相关。这让团队能定位到底是 retriever、generator、prompt 还是测试数据出了问题。[S3][S4][S7]

另一个优势是开源和可嵌入。相比纯 SaaS 平台,Ragas 可以直接放进 Python 流程、实验脚本或 CI 周期里;对已有 LangChain、LlamaIndex 或 LangSmith 工作流的团队,它也能作为评测指标层接入。[S2][S8][S9]

主要分歧:

第一是 LLM-as-a-judge 的可信度。Ragas 文档明确说明,LLM-based metrics 可能不总是对同一输入给出完全相同的结果;这类指标更接近人工评价,但也受到模型调用和提示词设计的影响。[S3]

第二是“框架”与“平台”的边界。LangSmith 的官方文档覆盖 datasets、evaluators、prompts、Studio、离线和在线评测,用来测试 agent 质量、迭代 prompt 和调试 live 环境。[S10] Ragas 则更像指标、测试集和实验库。团队如果需要协作界面、生产 trace 查询、权限、审计和仪表盘,通常还要接入 LangSmith、Braintrust、Arize 或自建平台。

第三是评测指标的选择成本。Ragas 指标很多,但文档也提醒,指标设计应强调可解释、客观和少量强信号,而不是堆很多弱信号。[S3] 这意味着 Ragas 不会自动替团队定义“什么才算业务成功”;业务样本、失败标签和阈值仍要由团队自己沉淀。

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: LangSmith、Giskard、DeepEval。

维度RagasLangSmithGiskardDeepEval
核心定位开源 LLM 应用评测库,强调指标、实验、测试集和反馈循环。[S2][S5]LangChain 的评测与观测平台,覆盖 datasets、evaluators、prompts、Studio、离线和在线评测。[S10]开源 Python 库与平台,面向 LLM 测试、评测和 red teaming。[S11]开源 LLM evaluation framework,面向 LLM 应用、agent、RAG、chatbot 和 prompt 评测。[S12]
RAG 评测起点就是 RAG 评测,论文强调 reference-free evaluation。[S7]可运行 RAG 评测并可与 Ragas 组合使用。[S9][S10]覆盖 LLM 测试与评测,也强调 red teaming。[S11]覆盖 RAG、agent 和 prompt 等场景,并提供多种指标。[S12]
工程形态更像 Python 评测库和实验框架。[S2][S5]更像托管平台和生产调试环境。[S10]开源库加企业平台。[S11]开源框架,Confident AI 是其企业平台。[S12]
适合场景团队已有应用和数据流,想先把指标、测试集、回归评测跑起来。已在 LangChain/LangGraph 生态内,需要 trace、dataset、prompt 和在线评测协同。更重视测试、风险发现和 red teaming 的团队。想用类似测试框架方式给 LLM 应用写 eval 的团队。

这几类工具不是完全互斥。Ragas 可以作为指标与测试集层,LangSmith 或其他平台可以承接 trace、可视化、协作和生产监控。真正的选型差异,更多在“团队要的是库、测试框架,还是完整平台”。

8. 信息缺口与后续观察

Ragas 没有公开足够完整的收入、付费客户、留存率、企业合同、云端产品定价和长期路线图,因此无法判断它从开源库走向商业产品的速度。

项目文档说明了 LLM-based 与 non-LLM-based 指标的机制差异,但不同指标在真实行业任务中的稳定性、成本、和人工评价一致性,仍需要团队用自己的数据验证。[S3]

Ragas 与 LangSmith、Giskard、DeepEval 等工具的边界也可能继续变化。后续可观察:Ragas 是否推出更强的托管产品,是否继续扩展 agent 和工具调用指标,是否增强生产数据闭环,以及开源核心与商业功能的分界。

9. 归纳洞察 ★

Ragas 的价值不在于告诉团队“这个 RAG 系统好不好”,而是把这个问题拆成几个更可操作的小问题:检索有没有找到对的上下文,回答有没有忠于上下文,最终响应有没有解决用户问题,工具调用有没有按预期发生。

它适合放在 LLM 应用从 demo 走向生产的中间层。太早用,团队可能连稳定样本都没有;太晚用,线上问题已经积累。比较合适的位置,是在应用有了第一批真实使用场景后,用 Ragas 把这些场景沉淀成可重复评测的数据集和指标。

Ragas 的边界也很明确:它提供评测组件,但不替代产品监控、团队协作、权限审计和业务 KPI。对成熟团队来说,它更像评测底座的一块拼图,而不是一站式质量平台。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-30
  • 最后复查(last_checked): 2026-07-30
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1Ragas 官网访问 2026-07-30
  2. [S2]Tier1Ragas Docs 源文件:Introduction访问 2026-07-30
  3. [S3]Tier1Ragas Docs 源文件:Overview of Metrics访问 2026-07-30
  4. [S4]Tier1Ragas Docs 源文件:List of available metrics访问 2026-07-30
  5. [S5]Tier1GitHub:vibrantlabsai/ragas访问 2026-07-30
  6. [S6]Tier1Y Combinator:Vibrant Labs访问 2026-07-30
  7. [S7]Tier1arXiv:Ragas: Automated Evaluation of Retrieval Augmented Generation访问 2026-07-30
  8. [S8]Tier1Ragas Docs 源文件:LangSmith integration访问 2026-07-30
  9. [S9]Tier2LangChain Blog:Evaluating RAG pipelines with Ragas + LangSmith访问 2026-07-30
  10. [S10]Tier1LangSmith Docs:Evaluation访问 2026-07-30
  11. [S11]Tier1Giskard Docs访问 2026-07-30
  12. [S12]Tier1GitHub:confident-ai/deepeval访问 2026-07-30