Techub News 消息,Meta FAIR 聯合牛津大學、倫敦大學學院的研究團隊發佈 AI 研究偏好模型(RPM),旨在讓 AI 研究智能體在執行耗時的 GPU 實驗前,對候選實驗方案進行排序,僅運行最有潛力的方案。該模型包含僅推理和智能體驅動兩種變體,使用凍結的預訓練大模型(Qwen3.6-27B),相關框架 AIRA-dojo 和基準 AIRS-Bench 已開源。 在 AIRS-Bench 的測試中,使用 RPM 後,平均歸一化得分從隨機選擇的 0.684 提升至 0.711(僅推理)和 0.729(智能體驅動)。效率方面,兩種 RPM 均能在約 15 小時内達到基綫模型 24 小時的性能水平,實現約 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基準上取得了新的最高性能記錄。(MarkTechPost)
内容來源:TECHUB NEWS
更多精彩內容,請登陸
財華香港網 (https://www.finet.hk/)
現代電視 (http://www.fintv.com)