Evaluation report · 8 tracks complete

Jev 1.13
作为奖励模型

一份面向模型发布的独立评测报告:在 7 个公开 benchmark 家族上检验偏好判断、过程监督、rubric 评审与模型级排序。

研究与实现 Linhao Wang ·
成功评测40,9400 API errors
最佳主指标92.58%RewardBench v1
输入量76.02Mtokens
估算输入成本$3.19@ $0.042 / 1M
Performance / 发布式总览

八条轨道,先看 Jev 与公开参考线的距离

40+

个官方榜单或论文主表中的强模型结果,与 Jev 同屏比较。

每条轨道单独注明 live、frozen 或 paper snapshot。

Benchmark performance

每行独立缩放 · ● Jev 1.13 ○ 所列最高公开参考

同协议内比较

分数均为各 benchmark 原生主指标;横向位置仅表达该行内的相对差距,不构成跨 benchmark 排名。RM-Bench 的 96.0 为仅报告 Overall 的公开榜首,RubricBench 对照为协议邻近参考。

偏好判断92.58%

RewardBench v1,距冻结榜首 2.53 pp。

聚合排序92.63

PPE Spearman ρ,高于 Athene-RM-8B。

主要缺口−18.39 pp

ProcessBench 相对 o1-mini,过程错误定位仍是硬伤。

02 / 难度曲线

两种 RM-Bench 协议呈现不同的难度曲线

Structured pairwise 随难度上升明显衰减;独立 pointwise 评分更稳定,并将官方四领域宏平均提高 2.50 个百分点。

RM-Bench:按难度分解

官方准确率 · Easy → Normal → Hard

RewardBench v1 92.58%

距离冻结榜首 2.53 pp;Reasoning 达 97.48%。

RewardBench 2 81.15%

超过 Gemini-2.5-Pro 参考值;Precise IF 是主要短板。

PRMBench 66.38%

仅比 GPT-4o 低 0.42 pp,距最佳模型结果 2.42 pp。

03 / SOTA 对比

八条轨道,逐项对照公开强模型

榜单不是同一时间点的“总排名”。每张表只在该 benchmark 的相同或最接近协议内排序,并展示来源快照与不可比边界。

Jev 1.13 榜首 / SOTA 代表性强基线 Δ = 模型分数 − Jev 分数
04 / 能力画像

Safety 稳定领先,Precise IF 明显掉队

色阶只表达同一行内部的相对强弱。不同 benchmark 的任务与计分规则不同,不应直接横向排序。

最强分项97.48%

RewardBench v1 · Reasoning

最弱分项50.63%

RewardBench 2 · Precise IF

最大应用信号92.63

PPE · Spearman ρ

05 / PPE

单条准确率接近 Athene-RM-8B,聚合排序更强

点位越靠右越好;Brier 分数单独列出且越低越好。Jev 更适合大样本模型排名,而不是把每一次判断当作人类真值。

Brier ↓ Jev 0.08Ensemble 0.05Athene-70B 0.07Athene-8B 0.10
06 / 效率

成本主要由长上下文任务驱动

圆点大小表示成功记录数;横轴为估算输入成本,纵轴为各 benchmark 主指标。跨 benchmark 的纵向位置仅作运行概览。

07 / 方法

可复现,也明确不可比之处

01

固定模型

全部成功记录由 API 返回 jev-1.13.0,候选顺序按样本 ID 确定性打乱。

02

遵循原生指标

每条轨道采用自己的官方或兼容主指标,不合成跨 benchmark 总分。

03

诚实对照

Baseline 来自官方论文或排行榜,但模型规模、推理预算和日期并不完全一致。

04

Oracle Rubric 边界

RubricBench 使用 human-authored rubric,但未复刻 CheckEval/TICK/OpenRubric 完整 pipeline。

阅读完整方法与限制
引用

引用这项评测

作者:Linhao Wang

欢迎就 Benchmark 测评、Reward Model 研究与工程应用合作交流。

wanglinhao4140@gmail.com
@misc{wang2026jev,
  author       = {Linhao Wang},
  title        = {Jev 1.13 as a Reward Model: An Eight-Track Benchmark Evaluation},
  year         = {2026},
  howpublished = {GitHub},
  url          = {https://github.com/goya4140/jev-reward-model-evaluation}
}