WellBridge AI
English中文(香港)中文(简体)
客戶登入

評估

有量度,才作宣稱。

WellBridge AI 先公佈評估方法,之後才公佈結果。在完成凍結測試框架的運行並保留紀錄之前,本頁每一項都是目標,而不是成果。

參考對等目標,尚待獨立核實。

在 WellBridge AI 有可重現的運行、並已保留其紀錄之前,這個標示會一直留在頁面上。它不是裝飾,也不會為了推出而移除。

方法

沒有凍結的測試框架,就不是量度。

  • 凍結並版本化的測試框架:每次運行都會記錄模型版本、提示、上下文、工具框架、權限與溫度。
  • 任何隨機性的代理任務,至少進行五次試驗,並報告信心區間。
  • 公開的第三方基準,與 WellBridge AI 的業務任務評估分開,兩者永遠不會混合平均。
  • 評審會被記錄;若由模型擔任評審,亦會列明該模型及其版本。
計分卡

正在追蹤的產品量度。

量度項目狀態
端到端任務成功率尚未量度
交付物獲接納而無須重做尚未量度
完成時間的中位數與 p95尚未量度
真人批核率與推翻率尚未量度
不安全動作的攔截率與誤攔率尚未量度
回滾次數與回滾成功率尚未量度
每項完成任務的成本與能耗尚未量度
使用者自報節省的時間與滿意度尚未量度
基準

基準項目,目前未有任何數字。

量度項目狀態
PaperBench待獨立測試
WideSearch待獨立測試
IFBench待獨立測試
HealthBench待獨立測試
PRBench — 財務待獨立測試
GPQA Diamond待獨立測試
Terminal-Bench待獨立測試
CoWorkBench待獨立測試

列出基準名稱,是為了讓方法可以被審視。這裡不印任何分數,因為 WellBridge AI 尚未有運行產生分數。這裡也不會轉載對照組的數值:把別人已公佈的表格放在空白欄位旁邊,只會令人誤讀為我們的數字。

桌面夥伴

WB Buddy 本身如何被量度。

  • 對照伺服器自己的事件紀錄,檢查任務狀態準確度。
  • 由完成到顯示之間的事件延遲。
  • 打擾頻率,應該維持在低水平。
  • 批核理解程度:讀者是否明白自己正在批核甚麼。
  • 無障礙程度,包括鍵盤、焦點與減少動態效果。
  • 虛假完成率,目標是零。
  • 權限違規,應該完全不出現。
  • 資源使用量,以及使用者是否可以暫停或關閉它。

數字將會放在哪裡

當運行完成後,量度值、日期、模型版本與保留的紀錄,會取代本頁的狀態欄。標示會在同時移除,而不會在此之前移除。

下一步

由一次對話開始。

諮詢是一次有範圍的對話,談的是你的需要,不是推銷。對話結束時,你會清楚知道本行是否適合這項工作。