WellBridge AI
English中文(香港)中文(简体)
客户登录

评估

有测量,才作宣称。

WellBridge AI 先公布评估方法,之后才公布结果。在完成冻结测试框架的运行并保留纪录之前,本页每一项都是目标,而不是成果。

参考对等目标,尚待独立核实。

在 WellBridge AI 有可重现的运行、并已保留其纪录之前,这个标示会一直留在页面上。它不是装饰,也不会为了推出而移除。

方法

没有冻结的测试框架,就不是测量。

  • 冻结并版本化的测试框架:每次运行都会记录模型版本、提示、上下文、工具框架、权限与温度。
  • 任何随机性的代理任务,至少进行五次试验,并报告信心区间。
  • 公开的第三方基准,与 WellBridge AI 的业务任务评估分开,两者永远不会混合平均。
  • 评审会被记录;若由模型担任评审,亦会列明该模型及其版本。
计分卡

正在追踪的产品测量。

测量项目状态
端到端任务成功率尚未测量
交付物获接纳而无须重做尚未测量
完成时间的中位数与 p95尚未测量
真人审批率与推翻率尚未测量
不安全动作的拦截率与误拦率尚未测量
回滚次数与回滚成功率尚未测量
每项完成任务的成本与能耗尚未测量
使用者自报节省的时间与满意度尚未测量
基准

基准项目,目前未有任何数字。

测量项目状态
PaperBench待独立测试
WideSearch待独立测试
IFBench待独立测试
HealthBench待独立测试
PRBench — 财务待独立测试
GPQA Diamond待独立测试
Terminal-Bench待独立测试
CoWorkBench待独立测试

列出基准名称,是为了让方法可以被审视。这里不印任何分数,因为 WellBridge AI 尚未有运行产生分数。这里也不会转载对照组的数值:把别人已公布的表单放在空白字段旁边,只会令人误读为我们的数字。

桌面伙伴

WB Buddy 本身如何被测量。

  • 对照服务器自己的事件纪录,检查任务状态准确度。
  • 由完成到显示之间的事件延迟。
  • 打扰频率,应该维持在低水平。
  • 审批理解程度:读者是否明白自己正在审批什么。
  • 无障碍程度,包括键盘、焦点与减少动态效果。
  • 虚假完成率,目标是零。
  • 权限违规,应该完全不出现。
  • 资源使用量,以及使用者是否可以暂停或关闭它。

数字将会放在哪里

当运行完成后,测量值、日期、模型版本与保留的纪录,会取代本页的状态栏。标示会在同时移除,而不会在此之前移除。

下一步

由一次对话开始。

咨询是一次有范围的对话,谈的是你的需要,不是推销。对话结束时,你会清楚知道我们是否适合这项工作。