ARD 用域名锚定的目录与联邦注册表描述、发现和验证智能体资源,为 MCP、A2A、API 与技能提供协议中立的发现层。
Tag
open-source
包含该标签的简调共 86 篇。
Cohere 发布的 20 亿参数开放语音识别模型,支持 14 种语言与 API、自托管、Model Vault 交付;导入时应实测口音、噪声、专有名词和未内置的时间戳与说话人分离需求。
Google 开源的命令行工具与技能包,让编码代理能够创建、评测并部署 Google Cloud 智能体项目。
Google Colab CLI 把 Colab 远程运行时带进本地终端,适合脚本执行、临时加速器任务和编码代理工作流,但仍需治理凭据、会话与成本。
Cohere 的开放权重代理式编码模型,以较小激活参数支持仓库级修改、终端任务和本地部署,但工程采用仍需独立验证正确性与工具权限。
NVIDIA 与众多安全、云、软件及开源机构发起的 AI 安全协作倡议,目标是共建可检查、可运行的开放防御模型、代理框架与工具,当前更适合跟踪贡献与参与试点,不宜当成成熟产品。
Stripe 与 OpenAI 共同开发的开放商业协议,为 AI 代理、买家和商家定义商品发现、结账与支付协作接口。
Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。
面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
Brain2Qwerty v2 是 Meta 面向非侵入式脑机接口研究的端到端脑信号到文本解码系统。
CHMv2 是 Meta 与世界资源研究所推出的开放模型与全球树冠高度地图,用于森林和城市树木监测。
Cloudflare 面向 Workers 推出的 Agent 开发与运行框架,以 Durable Objects 承载身份、状态、实时连接和定时任务。
OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。
Google 发布的开源 Python 库,用大模型从非结构化长文本抽取结构化信息,并把结果定位回原文以支持核查和可视化。
Llama Stack 起源于 Meta 的标准化 AI 应用接口提案;截至 2026 年 8 月,其官方仓库已更名并转向模型无关的 OGX。
NemoClaw 把 Agent、推理服务与 OpenShell 沙箱组合成可安装、可治理的参考栈,重点解决长期运行 Agent 的权限、网络与凭据边界。
NVIDIA 的开源 Agent 工具库,以插件化工作流连接模型、工具和框架,并提供观测、评测、分析与优化能力。
围绕多提供商 LLM 接口互操作建立的开放规范,统一请求、响应、工具调用、流式事件和智能体循环中的核心对象。
SAM 3.1 是 Meta 面向图像与视频检测、分割和跟踪的模型更新,重点优化多对象视频处理。
smolagents 是 Hugging Face 的开源 Agent 库,强调小型代码库、代码式行动、模型无关接入和可选沙箱执行。
Agent Payments Protocol(AP2)以可验证凭证和授权 Mandate 为核心,为智能体代表用户发起交易提供开放、支付方式无关的信任框架。
OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
NVIDIA KVPress 汇集多种训练无关的 KV Cache 压缩方法,并提供基于 Transformers 的统一接口与长上下文评测工具。
AssetOpsBench 用工业资产运维场景、专职智能体和多智能体编排蓝图,帮助团队构建并评估面向 Industry 4.0 的智能体系统。
Envoy AI Gateway 在 Kubernetes 与 Envoy Gateway 之上统一连接多种模型服务,为生成式 AI 请求提供路由、认证、策略和可观测能力。
Kilo Code 是开放源码的编程智能体平台,可在 IDE、终端及其他入口中生成和修改代码、执行命令、检查结果,并连接多种模型与工具。
OpenTelemetry GenAI 语义约定为模型调用、Agent、指标、事件和追踪定义共同字段,帮助不同框架与后端交换可观测数据。
Serena 是面向编码智能体的开源 MCP 工具包,通过语言服务器提供符号级检索、编辑、引用查找与项目记忆。
Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
Universal Commerce Protocol 通过可发现的能力、模块化结账与订单原语,为智能体、平台、商家和支付参与方提供开放的商业互操作层。
vLLM 社区维护的昇腾硬件插件,为大语言模型在 Ascend NPU 上提供与 vLLM 对接的推理和服务路径。
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
Microsoft Agent Framework 是面向生产环境的开源智能体框架,支持在 .NET 和 Python 中构建智能体及图式多智能体工作流。
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
A2A 协议的扩展机制,让智能体通过唯一 URI 声明、协商并启用领域能力,同时保持核心协议兼容。
Agent Network Protocol 试图用开放协议连接互联网中的智能代理,覆盖身份、能力描述、发现、消息与应用协作,但生产采用仍需验证成熟度和信任边界。
AlphaGenome 以长 DNA 序列预测多类功能输出并辅助评估变异效应;研究使用需控制输入、版本与证据链,不能直接替代临床判断。
BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。
Evo 2 从大规模基因组序列学习跨物种模式,可用于变异效应评估和序列生成研究,但输出不能替代实验、临床与生物安全审查。
Goose 是提供桌面端、命令行和 API 的本机开源智能体,可连接多种模型与 MCP 扩展执行工作流,但必须通过权限隔离和任务级验收控制风险。
HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
nano-vLLM 是一个轻量、可读的 vLLM 风格推理实现,适合教学、代码研读和受控实验,不宜未经压测直接替代成熟生产引擎。
Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。
面向 Kubernetes 集群的 vLLM 生产参考实现,组合推理引擎、请求路由和可观测组件。
vLLM Semantic Router 在模型服务前按请求语义选择模型、工具与策略,适合多模型推理平台,但需要用业务流量校准路由并保留安全回退。
Microsoft BitNet.cpp 是面向 1-bit 语言模型的开源推理框架,官方仓库提供本地构建、模型运行和基准工具。
Boltz-1 为蛋白质及相关生物分子结构预测提供开放模型与代码,适合具备计算生物学验证能力的研究团队复现和集成。
Chai-1 将蛋白质、小分子及其他生物分子信息纳入统一结构预测流程,适合科研团队评估候选复合物,但实验验证仍不可替代。
DeepEP 为混合专家模型训练与推理提供高吞吐、低延迟的 GPU 通信内核,适合能控制并测量底层分布式环境的平台团队。
FlashMLA 提供针对多头潜在注意力的高性能 CUDA 内核,适合有明确硬件、模型结构与基准能力的推理基础设施团队评估。
Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。
llms.txt 建议网站在根目录提供简洁的 Markdown 导航文件,帮助语言模型找到高价值内容,但它不是访问控制或收录保证。
NLWeb 让网站把既有结构化内容转化为可对话、可被智能体调用的接口,关键价值在内容治理与可控接入,而非单纯增加聊天框。
NVIDIA 的开源分布式推理编排栈,面向多节点模型服务的部署与运行管理。
NIXL 为分布式 AI 系统提供统一的数据传输接口与插件机制,重点服务 KV 缓存等跨内存层移动,价值取决于真实拓扑下的端到端验证。
OpenAI Codex CLI 是在终端运行的开源编码 agent,OpenAI 将其定位为可读取、修改和运行本地代码任务的开发工具。
SWE-bench Verified 是经人工核验的软件工程评测子集,用于更可靠地衡量模型或 agent 解决真实 GitHub issue 的能力。
SWE-Lancer 用真实自由职业软件工程任务和经济价值衡量模型表现,适合研究编码能力,但不能替代企业代码库中的安全与维护验收。
WebMCP 探索由网站直接声明可供浏览器 AI 代理调用的结构化工具,以降低纯视觉自动化的脆弱性,但仍需按演进中的标准治理。
Langflow 是用于可视化构建 AI 应用流程的开源开发工具。
Langroid 是面向语言模型应用与多智能体协作的开源 Python 框架。
marimo 是以 Python 文件为基础的响应式开源笔记本工具。
Microsoft Presidio 是用于识别与处理文本中敏感信息的开源工具。
MindsDB 是用于连接数据源、模型与应用工作流的开源平台。
OpenHands 是面向软件开发任务的开源 AI agent 平台。
Qdrant 是面向向量相似度检索与过滤的开源数据库。
Traceloop 是用于追踪和观测 LLM 应用执行过程的工具。
Unstructured 是用于将非结构化文件转换为可供下游处理的数据的工具与平台。
Weaviate 是面向向量检索与 AI 应用数据访问的数据库平台。
Axolotl 是用于语言模型后训练与微调的开源工具。
Cal.com 提供面向日程、预约与平台嵌入场景的 API、OAuth 和调度工作流。
llama.cpp 是以 C/C++ 实现的开源 LLM 推理项目,面向本地和异构硬件上的模型推理与服务。
Open WebUI 是面向本地与外部模型服务的可自托管聊天界面。
OpenTelemetry 是用于生成、收集和导出遥测数据的开源可观测性框架与规范。
Roo Code 是面向 IDE 的开源编码 Agent。
Unsloth 是用于本地运行和微调语言模型的开源工具项目。
Cline 是一个可在 IDE 和终端中运行的开源编码 Agent,并提供 SDK。
garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。
Qwen 团队开源的终端 AI 编码 Agent,支持交互、脚本、IDE、SDK 与实验性 daemon 模式。
Agent Communication Protocol,面向 AI agents、应用和人类协作的开放通信协议,目标是让不同框架和平台里的 agent 能用标准接口互操作。
Agent-User Interaction Protocol,面向 AI agents 与用户界面的开放、轻量、事件式连接协议,解决 agent 后端和前端 UI 的实时协作问题。
面向 AI 工程师和领域专家的开源数据协作工具,用于构建、整理和迭代高质量训练与评测数据集;当前主仓库已进入成熟维护状态,不再规划新增功能。
开源 AI 编程 agent,提供 VS Code、JetBrains 和 CLI 入口,强调自定义模型、上下文和团队可共享配置;官网显示项目已加入 Cursor。
Stanford CRFM 推出的语言模型整体评测项目,强调用多场景、多指标和透明报告评估模型能力、局限与风险;GitHub 仓库显示其已于 2026-06-01 进入维护模式。
开源 AI engineering / LLM observability 平台,把 traces、monitoring、datasets、experiments、evals 和 prompt 管理连接成一个持续改进循环。
面向大语言模型和多模态模型的开源高性能推理服务框架,强调低延迟、高吞吐、OpenAI 兼容接口和从单 GPU 到分布式集群的部署。