
模型 GPT-5.6 Luna 發現 69 個已確認的錯誤,花費 $0.20,而模型 GPT-6 Astra 則發現 92 個錯誤,花費 $5.66。
這意味著 Luna 模型的成本是 Astra 模型的 28 分之 1,但準確度卻低了 24%,尤其是在安全性錯誤的檢測方面。
這些結果在 news.ycombinator.com 上引發了關於是否有一個價格為 $1.20 的模型足夠好用於代碼檢查的討論。
值得注意的是,GPT-5.6 Luna 模型儘管成本低,但仍然表現出色。
這個比較可能會改變開發人員選擇代碼檢查模型的方式,因為現在他們可以考慮不僅是準確度,還有模型的成本。