arize-experiment 技能提供了一套完整的 CLI 工作流,用于创建、运行、导出和比较 Arize 实验,以评估和基准测试模型性能。
涵盖实验 CRUD(ax experiments list/get/create/export/delete),支持按数据集和空间筛选、分页,以及多种输出格式(表格、JSON、CSV、Parquet 或文件路径)。
默认通过 REST API 将实验运行导出为 JSON,也可使用 --all 参数通过 Arrow Flight 进行批量传输;若 REST 导出恰好返回 500 条运行,则可能被截断,应使用 --all 重新导出。
提供端到端工作流:导出数据集、为每个示例调用真实模型 API(OpenAI、Anthropic、Gemini 或任何兼容 OpenAI 的端点)以构建 runs 文件,然后创建并验证实验。绝不伪造或模拟输出——如果无法访问 API,应停止并报告缺失内容。
支持使用 jq 比较两个实验——平均评估分数、分数分布、逐示例差异和回归检测——并将导出的运行管道化到其他工具(计数、提取输出、筛选低分、转换为 CSV)。
需要 ax CLI 和已配置的 Arize profile;包含常见错误(命令未找到、401 Unauthorized、无效的 runs 文件、数据集缺失)的故障排除,以及安全指引:切勿读取 .env 文件或搜索凭据。