AI 工具库

Model Evaluation清除筛选

Langfuse

模型与开发平台

追踪和评估 AI 应用的调用过程,用运行数据改进代理质量。

可观测性模型评估

Label Studio

数据分析

标注文本、图像、音频与代理轨迹,准备模型训练和评估数据。

数据标注模型评估

MLflow

模型与开发平台

追踪模型实验并评估 AI 应用,管理模型和代理的开发流程。

实验管理模型评估

Weights & Biases

模型与开发平台

追踪机器学习实验,观察和评估 AI 模型与代理表现。

实验管理模型评估

Arize

模型与开发平台

观察和评估 AI 应用的运行表现,定位模型与代理问题。

可观测性模型评估

Respan

API网关与代理

把模型网关、评测和调用观测放进同一工作流程。

AI网关模型评测

BenchGen

智能体与自动化

用于智能任务处理,支持模型评测、通用智能体、云基础设施与数据管理。

云基础设施模型评测通用智能体

EverMind

智能体与自动化

用于智能任务处理,支持上下文记忆、通用智能体、模型评测与团队协作。

上下文记忆模型评测通用智能体

Fiddler AI

智能体与自动化

用于智能任务处理,支持通用智能体、权限与策略管理与模型评测。

权限与策略管理模型评测通用智能体

Oqoqo

智能体与自动化

用于智能任务处理,支持通用智能体、模型评测、智能体构建与云基础设施。

智能体构建模型评测通用智能体

Runsight

智能体与自动化

用于智能任务处理,支持工作流编排、通用智能体、模型评测与内容设计。

工作流编排模型评测通用智能体

Snorkel

智能体与自动化

用于智能任务处理,支持数据管理、模型评测、模型训练与微调与智能体构建。

数据管理模型训练与微调模型评测

UserTrace

智能体与自动化

用于智能任务处理,支持模型评测、模型监控与通用智能体。

模型监控模型评测通用智能体

Vivgrid

智能体与自动化

用于智能任务处理,支持通用智能体、模型评测、模型监控与模型推理。

模型监控模型评测通用智能体

Acrux Core

通用助手

面向日常问答与信息处理,支持提示词资源、模型评测与模型监控。

提示词资源模型监控模型评测

Artificial Analysis

通用助手

面向日常问答与信息处理,支持API调用、模型评测与模型接入。

API调用模型接入模型评测

Scale AI

通用助手

面向日常问答与信息处理,支持AI系统开发、模型评测与数据管理。

AI系统开发数据管理模型评测

Sigma AI

通用助手

面向日常问答与信息处理,支持模型评测、AI系统开发与数据管理。

AI系统开发数据管理模型评测

WhatLLM.org

通用助手

面向日常问答与信息处理,支持模型评测、商业分析与模型接入。

商业分析模型接入模型评测

hume

语音与转写

用于语音与音频工作,支持问答对话、用户反馈、模型评测与API调用。

模型评测用户反馈问答对话

Arena AI

编程开发

面向软件开发,支持模型接入、模型评测与问答对话。

模型接入模型评测问答对话

Codeflash

编程开发

面向软件开发,支持模型评测与自动化执行。

模型评测自动化执行

Devin

编程开发

面向软件开发,支持模型评测与自动驾驶。

模型评测自动驾驶

IdeaPulley

编程开发

面向软件开发,支持模型评测与投资研究。

投资研究模型评测

已显示24 款工具,共33