一項最新的社區測試引發關注:同樣使用GPT-6模型,Codex提供的推理預算可能遠低於直接調用OpenAI API,即使選擇相同的推理強度,差距依然顯著。
在最高推理檔位(Max)下,GPT-6 Astra通過API調用時的推理預算達到832,而Codex僅爲128,相差約6.5倍;GPT-6
Sol的差距更加突出,API端達到768,Codex端只有62,相差約12.4倍。社區測試還顯示,這種差異並非僅存在於最高檔位,在其他可比較的推理強度設置下,Codex的推理預算也普遍低於API端。
所謂推理預算,通常指模型內部推理過程可使用的計算預算,並不等同於實際消耗的Token數量。OpenAI官方文檔確認,推理強度會影響模型的思考深度、響應速度和Token消耗,但尚未證實上述832、128、768和62等具體預算數值。
這一差異可能影響複雜軟件工程任務的表現。對於簡單代碼生成和常規修改,較低的推理預算有利於提高響應速度、控制計算成本;但在大型代碼庫重構、跨模塊依賴分析、複雜故障排查以及長鏈條任務規劃中,更充足的推理預算可能幫助模型探索更多方案、檢查潛在錯誤並完成更深入的驗證。