Techub News 消息,DeepSeek V4 Flash 在 Composio 獨立測試中表現不佳,僅完成 53.8% 的復雜代理任務。 該測試覆蓋 30 個多步驟工作流,涉及 Gmail、GitHub、Slack 等實際工具,共進行 240 次運行。結果顯示,模型在不同智能體框架下的表現差異顯著,其中 Pi Agent 完成 20 項任務,表現最佳。盡管該模型輸入 token 定價低至 0.14 美元/百萬,約為同類産品的十分之一,但高失敗率可能帶來額外的計算與調試成本。(CryptoBriefing)
内容來源:TECHUB NEWS
更多精彩內容,請登陸
財華香港網 (https://www.finet.hk/)
現代電視 (http://www.fintv.com)