跳到正文
RCreddit.com·
暂不在当前实时榜单

Jev's calibration was measured. The LLMs won [D]

AI 摘要

Jev Benchmarks, utilizing "Reinforcement Learning for Calibrated Decisions," measured the calibration of Jev against LLMs like Gemini 3.8 Flash 2.0 and DeepSeek V4.1 Flash 2.8. While Jev maintained 95% accuracy and handled 86% of yes/no decisions, its calibration gap was higher across all categories. For instance, in yes/no, Jev scored 5.0 compared to Gemini 3.8 Flash 2.0's 2.0, indicating that despite its accuracy, Jev was worse calibrated than the LLMs.

为什么是这条

This report uniquely details Jev's calibration gap against LLMs like Gemini 3.8 Flash 2.0, showing it is worse calibrated despite higher accuracy, unlike other reports focusing solely on accuracy.

时间与来源

时间显示为 UTC

显示时区:UTC

本地时区尚不可用,暂时显示 UTC。

收录当时偏移:UTC+02026年9月22日 05:01 UTC

收录
2026年9月22日 05:01
来源类型
开发者社区

本站未收录正文。

前往源站阅读 →
来源·reddit.com