研究人員發現,一個座標可以破壞模型Gemma-3的abliteration。這個座標,Channel 2339,具有巨大的尺度和離散度,與其他模型有所不同。
使用Winsorization方法來減輕這個座標的影響,可以恢復模型的性能。研究顯示,Gemma-3-12b的abliteration因為這個主導座標而失敗。
模型Gemma-3在5小時內獲得了7分。這項研究強調了仔細分析和處理數據以確保模型可靠運行的重要性。
這一發現可能對AI模型的開發和使用具有重大影響,因為它強調了模型架構中的潛在漏洞。研究人員繼續研究改善AI模型穩定性和性能的方法。