评估
有测量,才作宣称。
WellBridge AI 先公布评估方法,之后才公布结果。在完成冻结测试框架的运行并保留纪录之前,本页每一项都是目标,而不是成果。
参考对等目标,尚待独立核实。
在 WellBridge AI 有可重现的运行、并已保留其纪录之前,这个标示会一直留在页面上。它不是装饰,也不会为了推出而移除。
方法没有冻结的测试框架,就不是测量。
- 冻结并版本化的测试框架:每次运行都会记录模型版本、提示、上下文、工具框架、权限与温度。
- 任何随机性的代理任务,至少进行五次试验,并报告信心区间。
- 公开的第三方基准,与 WellBridge AI 的业务任务评估分开,两者永远不会混合平均。
- 评审会被记录;若由模型担任评审,亦会列明该模型及其版本。
计分卡
正在追踪的产品测量。
| 测量项目 | 状态 |
|---|---|
| 端到端任务成功率 | 尚未测量 |
| 交付物获接纳而无须重做 | 尚未测量 |
| 完成时间的中位数与 p95 | 尚未测量 |
| 真人审批率与推翻率 | 尚未测量 |
| 不安全动作的拦截率与误拦率 | 尚未测量 |
| 回滚次数与回滚成功率 | 尚未测量 |
| 每项完成任务的成本与能耗 | 尚未测量 |
| 使用者自报节省的时间与满意度 | 尚未测量 |
基准
基准项目,目前未有任何数字。
| 测量项目 | 状态 |
|---|---|
| PaperBench | 待独立测试 |
| WideSearch | 待独立测试 |
| IFBench | 待独立测试 |
| HealthBench | 待独立测试 |
| PRBench — 财务 | 待独立测试 |
| GPQA Diamond | 待独立测试 |
| Terminal-Bench | 待独立测试 |
| CoWorkBench | 待独立测试 |
列出基准名称,是为了让方法可以被审视。这里不印任何分数,因为 WellBridge AI 尚未有运行产生分数。这里也不会转载对照组的数值:把别人已公布的表单放在空白字段旁边,只会令人误读为我们的数字。
桌面伙伴
WB Buddy 本身如何被测量。
- 对照服务器自己的事件纪录,检查任务状态准确度。
- 由完成到显示之间的事件延迟。
- 打扰频率,应该维持在低水平。
- 审批理解程度:读者是否明白自己正在审批什么。
- 无障碍程度,包括键盘、焦点与减少动态效果。
- 虚假完成率,目标是零。
- 权限违规,应该完全不出现。
- 资源使用量,以及使用者是否可以暂停或关闭它。
数字将会放在哪里
当运行完成后,测量值、日期、模型版本与保留的纪录,会取代本页的状态栏。标示会在同时移除,而不会在此之前移除。