70B Modelinde Residual Stream Dekompozisyonu: Sparse Autoencoder Analizi
Sparse Autoencoder (SAE) mimarileri, büyük dil modellerinin gizli katmanlarındaki polisemantik nöron ateşlemelerini bağımsız kavram vektörlerine ayrıştırarak içsel mantık haritasını gün yüzüne çıkarıyor.