根據 Artificial Analysis 已更新的 AA-Briefcase 基準測試,Kimi K3 達成 1543 分 Elo 分數,僅落後於 Claude Fable 5 的 1574 分,並超越 GPT-5.6 Sol 的 1501 分。該基準測試在 91 項保密任務中,評估模型在資訊擷取、文件分析與交付物生成方面的表現。
然而,K3 的性能提升伴隨了顯著更高的成本:每個任務 10.57 美元,約為 Kimi K2.6 的 10 倍。該模型平均進行 83 次迭代,並在每個任務產生 120,000 個 tokens,完成時間需 56.4 分鐘,約為 Fable 5 的 2.5 倍。