Исследователи обнаружили, что одна координата может сломать abliteration на модели Gemma-3. Эта координата, Channel 2339, имеет огромный масштаб и дисперсию, что отличает ее от других моделей.
Использование метода Winsorization для смягчения влияния этой координаты позволяет восстановить производительность модели. Исследование показало, что abliteration на Gemma-3-12b терпит неудачу из-за этой доминирующей координаты.
Модель Gemma-3 получила 7 баллов за 5 часов. Это исследование подчеркивает важность тщательного анализа и обработки данных для обеспечения надежной работы моделей.
Это открытие может иметь значительные последствия для разработки и использования моделей AI, поскольку оно подчеркивает потенциальные уязвимости в их архитектуре. Исследователи продолжают изучать способы улучшения стабильности и производительности моделей AI.