Harvey LAB 定价配置指南:compare.py 中模型价格表的 4 个核心机制
Harvey LAB 定价配置指南:compare.py 中模型价格表的 4 个核心机制【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LAB 是一个开源的法律 Agent 基准测试项目,用于评估大模型 Agent 完成真实法律任务的能力。它的对比仪表盘会自动估算每次运行的 API 花费,而这一切都来自 evaluation/compare.py 里的一张模型价格表。本文带你快速看懂这张价格表的结构、匹配逻辑、成本公式和图表联动,无需深入代码也能上手。 价格表在哪里:MODEL_INFO 字典所有模型的计费信息集中在 evaluation/compare.py 的MODEL_INFO字典中,每个条目是一个三元组:位置含义示例第 1 项仪表盘上的展示名Sonnet 5第 2 项每百万输入 token 价格(美元)3.0第 3 项每百万输出 token 价格(美元)15.0覆盖范围包括 Claude 系列、GPT 系列、Gemini 系列,以及经由 Fireworks、Baseten 网关提供的 Kimi、GLM、DeepSeek、Nemotron 等开源模型。价格来源于各供应商公开定价页,注释中已标明出处。 注意:表中价格是标准档位的每百万 token 单价,长上下文加成未计入,所以仪表盘显示的是估算成本。 核心机制 1:最长前缀匹配查找模型 ID 来自运行时的config.json,而价格表用的是短名称。evaluation/compare.py 的_model_info()用最长前缀匹配解决两者差异:先去掉供应商前缀(如anthropic/claude-sonnet-4-6→claude-sonnet-4-6)再找MODEL_INFO中满足完全相等或以键-开头的最长键这样既能区分GLM-5.2和GLM-5这类同名不同档的模型,也能让claude-sonnet-4-6-high这种带推理档位后缀的 ID 正确落到claude-sonnet-4-6上。若查不到任何键,会直接抛出明确的错误提示,提醒你去补全价格表。 核心机制 2:成本公式单条运行的成本由 evaluation/compare.py 的_compute_cost()计算:成本 输入 token ÷ 100 万 × 输入单价 输出 token ÷ 100 万 × 输出单价其中输入/输出 token 数取自每次运行落盘的scores.json里的cost字段。同一模型同一任务多次运行时,系统只保留时间戳最新的一次,避免重复计费。 核心机制 3:成本如何进入对比仪表盘compare.py生成三个层级的对比视图,成本数据贯穿其中:单任务对比(--task):生成质量 vs 成本散点图,一眼看出性价比单领域对比(--area):按法律业务领域聚合各模型总成本全局对比(--all):汇总所有任务,输出全通过率 vs 成本帕累托图,帮助找到最优模型-任务组合具体绘图函数在 evaluation/charts.py 的pareto_scatter(),只有当存在cost 0的运行记录时才会绘制成本图,逻辑见 evaluation/compare.py。 核心机制 4:成本与评分的联合排序每次运行的成本在 evaluation/compare.py 中被四舍五入到两位小数并写入运行记录,随后在_aggregate_across_tasks()里按模型累加,与全通过率(all-pass rate)一起构成排行榜。也就是说:分数回答做得好不好,成本回答花了多少钱,两者共同决定模型的性价比排名。✅ 如何为新模型配置价格如果你的模型 ID 出现在运行记录中却不在价格表里,对比脚本会报出No model metadata configured for ...错误。处理思路很简单:在MODEL_INFO中按模型ID: (展示名, 输入单价, 输出单价)的格式新增一行即可,注意:展示名可用后缀区分不同网关的同一模型(如GLM 5.2 (Baseten))键名设计要考虑前缀匹配,避免短键误吞长键单价单位为美元/百万 token,含网关费用的按官方页计价 延伸阅读资料路径端到端上手教程docs/tutorial.md架构说明(含成本看板介绍)docs/architecture.md评分策略与 scores.json 结构docs/eval-strategies.md单次运行 HTML 报告evaluation/report.py图表绘制模块evaluation/charts.py理解这张价格表后,你跑完任何一批 sweep,都能在对比仪表盘里同时看到哪个模型法律任务完成得最好和哪个模型最划算两个答案——这正是 Harvey LAB 区别于纯精度榜单的关键设计。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考