Gate News 訊息,4 月 27 日——Google DeepMind 的資深產品經理、以及 Google AI Studio 的產品負責人 Logan Kilpatrick 表示,在 X 上,每一家正在打造基於 AI 的產品的公司都應建立自己的自訂基準,用以衡量 AI 模型的效能。他將其描述為一種方法,使模型改進能夠「讓貴公司獲益不成比例」,並敦促創辦人與商業領袖「從明天開始。」
多數公司目前依賴公開排行榜來選擇 AI 模型,但這些排行榜衡量的是通用能力,往往與特定商業情境不匹配。Kilpatrick 以一家合約審閱公司為例,該公司最關注的是條款抽取的準確度——而這項能力在公開基準中並不存在,導致無法評估模型在該任務上的表現。自訂基準提供兩項關鍵優勢:第一,它們讓公司能夠針對各次模型更新,評估其在自身商業任務上的表現,並選擇在其實際使用情境中表現最佳的模型,而非整體排名最高的模型;第二,它們讓公司能夠與模型供應商分享這些測試集,從而在與公司業務息息相關的領域推動持續最佳化。
Kilpatrick 指出,像 Zapier 和 Sierra 這樣的公司已在採用這種做法,他表示:「這裡可以創造出很多 alpha。」
免責聲明:本頁面資訊可能來自第三方,不代表 Gate 的觀點或意見。頁面顯示的內容僅供參考,不構成任何財務、投資或法律建議。Gate 對資訊的準確性、完整性不作保證,對因使用本資訊而產生的任何損失不承擔責任。虛擬資產投資屬高風險行為,價格波動劇烈,您可能損失全部投資本金。請充分了解相關風險,並根據自身財務狀況和風險承受能力謹慎決策。具體內容詳見
聲明。
相關文章
IREN 透過全股票併購案取得 Mirantis,$625M 用於擴展 AI 雲端平台
根據 BlockBeats,IREN Limited 同意在 5 月 5 日以全股票交易方式,約 6.25 億美元收購雲端基礎設施軟體公司 Mirantis。此次收購旨在透過引入軟體與編排能力,來強化 IREN 的 AI 雲端能力,並……
GateNews1小時前
Anthropic 執行長:美國正考慮簡化 AI 模型發布流程,競爭對手落後 1-3 個月
根據 金十,Anthropic 的執行長在 5 月 5 日透露,美國政府似乎正在考慮簡化發布人工智慧模型的流程。執行長指出,其他大型 AI 實驗室的能力可能會比 Anthropic 落後 1 到 3
GateNews2小時前
SGLang 團隊完成 $100M 種子輪融資,估值為 $400M ,Accel 領投
根據 Beating,開源推理引擎 SGLang 背後的團隊已正式成立 RadixArk,並完成一輪 1 億美元種子融資,投後估值為 4 億美元。Accel 領投此輪,Spark Capital 共同擔任領投方投資人。半導體競爭對手 Nvidia(透過
GateNews2小時前
OpenAI 賦予 8,000 名開發者 10 倍 Codex 速率限制提升,直到 6 月 5 日
根據 Beating,OpenAI 向在舊金山報名 GPT-5.5 離線活動的 8,000 多名開發者寄出了電子郵件,授予他們自即日起至 6 月 5 日止的 Codex 速率限制 10 倍提升。所有申請者都會獲得該獎勵,不論他們是否參加了該活動
GateNews2小時前
OpenAI 與安以捺匹克的合資企業正在洽談,以在 5 月 5 日收購三家 AI 服務公司
根據 Jin 10,OpenAI 與 Anthropic 的合資企業正在洽談於 5 月 5 日收購三家 AI 服務公司。據報導,目標公司包括專注於工程的 AI 服務公司
GateNews2小時前
Anthropic 週二推出 10 個用於金融服務的 AI 代理
Anthropic 於週二推出了十個新的 AI 代理程式,旨在處理金融服務任務,包括起草客戶會議簡報、審閱財務報表,以及將案件升級以供法規遵循審查。這些工具鎖定銀行、保險、資產管理與金融科技領域的專業人士
GateNews2小時前