Jev 1.13
作为奖励模型
一份面向模型发布的独立评测报告:在 7 个公开 benchmark 家族上检验偏好判断、过程监督、rubric 评审与模型级排序。
八条轨道,先看 Jev 与公开参考线的距离
个官方榜单或论文主表中的强模型结果,与 Jev 同屏比较。
每条轨道单独注明 live、frozen 或 paper snapshot。Benchmark performance
每行独立缩放 · ● Jev 1.13 ○ 所列最高公开参考
分数均为各 benchmark 原生主指标;横向位置仅表达该行内的相对差距,不构成跨 benchmark 排名。RM-Bench 的 96.0 为仅报告 Overall 的公开榜首,RubricBench 对照为协议邻近参考。
RewardBench v1,距冻结榜首 2.53 pp。
PPE Spearman ρ,高于 Athene-RM-8B。
ProcessBench 相对 o1-mini,过程错误定位仍是硬伤。
两种 RM-Bench 协议呈现不同的难度曲线
Structured pairwise 随难度上升明显衰减;独立 pointwise 评分更稳定,并将官方四领域宏平均提高 2.50 个百分点。
距离冻结榜首 2.53 pp;Reasoning 达 97.48%。
超过 Gemini-2.5-Pro 参考值;Precise IF 是主要短板。
仅比 GPT-4o 低 0.42 pp,距最佳模型结果 2.42 pp。
八条轨道,逐项对照公开强模型
榜单不是同一时间点的“总排名”。每张表只在该 benchmark 的相同或最接近协议内排序,并展示来源快照与不可比边界。
Safety 稳定领先,Precise IF 明显掉队
色阶只表达同一行内部的相对强弱。不同 benchmark 的任务与计分规则不同,不应直接横向排序。
RewardBench v1 · Reasoning
RewardBench 2 · Precise IF
PPE · Spearman ρ
单条准确率接近 Athene-RM-8B,聚合排序更强
点位越靠右越好;Brier 分数单独列出且越低越好。Jev 更适合大样本模型排名,而不是把每一次判断当作人类真值。
成本主要由长上下文任务驱动
圆点大小表示成功记录数;横轴为估算输入成本,纵轴为各 benchmark 主指标。跨 benchmark 的纵向位置仅作运行概览。
可复现,也明确不可比之处
固定模型
全部成功记录由 API 返回 jev-1.13.0,候选顺序按样本 ID 确定性打乱。
遵循原生指标
每条轨道采用自己的官方或兼容主指标,不合成跨 benchmark 总分。
诚实对照
Baseline 来自官方论文或排行榜,但模型规模、推理预算和日期并不完全一致。
Oracle Rubric 边界
RubricBench 使用 human-authored rubric,但未复刻 CheckEval/TICK/OpenRubric 完整 pipeline。
@misc{wang2026jev,
author = {Linhao Wang},
title = {Jev 1.13 as a Reward Model: An Eight-Track Benchmark Evaluation},
year = {2026},
howpublished = {GitHub},
url = {https://github.com/goya4140/jev-reward-model-evaluation}
}