評估
有量度,才作宣稱。
WellBridge AI 先公佈評估方法,之後才公佈結果。在完成凍結測試框架的運行並保留紀錄之前,本頁每一項都是目標,而不是成果。
參考對等目標,尚待獨立核實。
在 WellBridge AI 有可重現的運行、並已保留其紀錄之前,這個標示會一直留在頁面上。它不是裝飾,也不會為了推出而移除。
方法沒有凍結的測試框架,就不是量度。
- 凍結並版本化的測試框架:每次運行都會記錄模型版本、提示、上下文、工具框架、權限與溫度。
- 任何隨機性的代理任務,至少進行五次試驗,並報告信心區間。
- 公開的第三方基準,與 WellBridge AI 的業務任務評估分開,兩者永遠不會混合平均。
- 評審會被記錄;若由模型擔任評審,亦會列明該模型及其版本。
計分卡
正在追蹤的產品量度。
| 量度項目 | 狀態 |
|---|---|
| 端到端任務成功率 | 尚未量度 |
| 交付物獲接納而無須重做 | 尚未量度 |
| 完成時間的中位數與 p95 | 尚未量度 |
| 真人批核率與推翻率 | 尚未量度 |
| 不安全動作的攔截率與誤攔率 | 尚未量度 |
| 回滾次數與回滾成功率 | 尚未量度 |
| 每項完成任務的成本與能耗 | 尚未量度 |
| 使用者自報節省的時間與滿意度 | 尚未量度 |
基準
基準項目,目前未有任何數字。
| 量度項目 | 狀態 |
|---|---|
| PaperBench | 待獨立測試 |
| WideSearch | 待獨立測試 |
| IFBench | 待獨立測試 |
| HealthBench | 待獨立測試 |
| PRBench — 財務 | 待獨立測試 |
| GPQA Diamond | 待獨立測試 |
| Terminal-Bench | 待獨立測試 |
| CoWorkBench | 待獨立測試 |
列出基準名稱,是為了讓方法可以被審視。這裡不印任何分數,因為 WellBridge AI 尚未有運行產生分數。這裡也不會轉載對照組的數值:把別人已公佈的表格放在空白欄位旁邊,只會令人誤讀為我們的數字。
桌面夥伴
WB Buddy 本身如何被量度。
- 對照伺服器自己的事件紀錄,檢查任務狀態準確度。
- 由完成到顯示之間的事件延遲。
- 打擾頻率,應該維持在低水平。
- 批核理解程度:讀者是否明白自己正在批核甚麼。
- 無障礙程度,包括鍵盤、焦點與減少動態效果。
- 虛假完成率,目標是零。
- 權限違規,應該完全不出現。
- 資源使用量,以及使用者是否可以暫停或關閉它。
數字將會放在哪裡
當運行完成後,量度值、日期、模型版本與保留的紀錄,會取代本頁的狀態欄。標示會在同時移除,而不會在此之前移除。