가중치 고유값을 보면 오차가 어디서 오는지 보인다
ICLR 2026 구두 발표 ‘Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning Regime’ 짧게 읽기
Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning RegimeICLR 2026 Oral
한 줄 요약
특징을 배우는 얕은 신경망에서 데이터 양과 가중치 감쇠(weight decay)에 따라 오차가 줄어드는 속도를 영역별로 모두 구했고, 학습된 가중치의 고유값 분포만 보고도 오차가 과적합에서 오는지 과소적합에서 오는지 가려낼 수 있음을 보였다.
무엇이 달라졌나
신경망 스케일링 법칙(scaling law)의 이론은 지금까지 대부분 특징이 고정된 랜덤 특징(random features)이나 커널 영역에 머물렀다(1절). 이 논문은 특징을 실제로 배우는 두 모델, 대각 신경망(diagonal network)과 이차 활성 함수를 쓰는 두 층 신경망을 골라 가중치 감쇠를 건 학습의 최솟값을 끝까지 풀었다.
핵심 결과는 위상도(phase diagram)다(결과 1, 식 11, 그림 1). 가중치 감쇠가 약하면 데이터가 늘수록 오차가 \(n_{\rm eff}^{-1+1/(2\gamma)}\)로 빠르게 줄다가, 어느 지점부터 잡음을 외우기 시작해 도리어 오른다. 유효 표본 수 \(n_{\rm eff}\)가 차원 \(d\)에 닿으면 오차는 \(\lambda^{-2/3}\) 크기의 봉우리를 찍고, 그 뒤로는 \(d/n_{\rm eff}\)로 다시 준다. 여기서 \(n_{\rm eff}\)는 대각 신경망에서 \(n\), 이차 신경망에서 \(n/d\)다. 이렇게 한 가지 변수로 바꿔 쓰면 두 모델의 위상도가 거의 똑같아진다. 가중치 감쇠를 \(\sqrt{n_{\rm eff}/d}\) 근처로 맞추면 오차가 오르는 구간이 사라지고 베이즈 최적 속도에 이른다(따름정리 1).
(가) 데이터가 늘 때의 초과 위험
(나) 학습된 가중치의 스펙트럼
어떻게 보였나
두 모델은 신호 처리의 고전 문제로 정확히 옮겨진다(1절, 부록 A). 대각 신경망에 가중치 감쇠를 걸면 LASSO가 되고, 이차 신경망은 핵 노름(nuclear norm)을 벌점으로 쓰는 행렬 압축 센싱(matrix compressed sensing)이 된다. 목표 함수의 고유값은 \(\sqrt{d}\,i^{-\gamma}\)처럼 거듭제곱으로 줄어든다고 둔다.
이렇게 옮기고 나면 근사 메시지 전달(approximate message passing)의 상태 진화(state evolution) 식으로 오차와 가중치 분포를 계산할 수 있다. 학습된 가중치는 목표 가중치에 잡음을 얹은 뒤 일정 크기 아래를 0으로 깎은 모양이 된다(결과 2, 식 15와 16). 그래서 스펙트럼은 0에 몰린 고유값, 0 근처의 벌크(bulk), 벌크 밖으로 튀어나온 고유값으로 나뉜다.
이 세 부분이 오차 분해와 그대로 겹친다(결과 3, 식 17과 18). 벌크의 2차 모멘트는 학습한 잡음, 곧 과적합 오차다. 벌크에 묻혀 드러나지 않은 목표 고유값은 놓친 특징, 곧 과소적합 오차다. 튀어나온 고유값의 위치가 어긋난 만큼이 근사 오차다. 논문은 이 대응으로 스펙트럼 위상 여덟 가지를 나누고(2.3절), 규제가 알맞을 때 스펙트럼이 두꺼운 꼬리(heavy tail)로 넘어가는 모습이 일반화가 좋아지는 구간과 겹친다고 짚는다. 학습된 신경망의 가중치 스펙트럼에서 두꺼운 꼬리와 일반화 성능이 함께 간다는 Martin과 Mahoney의 관찰을 원리에서부터 설명한 셈이다.
눈여겨볼 점
첫째, 스케일링 지수는 상태 진화 식이 증명된 범위 밖에서도 맞는다고 가정하고 얻었다. 증명은 \(n_{\rm eff}/d\)와 \(\lambda\)를 고정한 극한에서만 성립하고, 논문은 이 확장을 추측 1로 남겼다(2.4절). 대신 \(d\)를 100에서 800까지 바꾼 실험이 이론 곡선과 잘 맞는다(그림 3). 이 실험에는 CPU 약 25만 시간과 실행당 최대 1,800GB 메모리가 들었다(부록 F).
둘째, 다룬 것은 가우시안 입력, 두 층, 이차 활성과 대각 구조, 그리고 전역 최솟값뿐이다. SGD가 실제로 어느 해에 닿는지, 깊은 신경망에서도 같은 분해가 성립하는지는 결론에서 과제로 남겼다(3절).
열린 질문
- 벌크, 묻힌 고유값, 튀어나온 고유값과 오차 항의 짝이 깊은 신경망이나 SGD로 학습한 가중치에서도 유지된다면, 학습된 가중치의 스펙트럼만 보고 지금 모델이 과적합 쪽인지 과소적합 쪽인지 진단하는 도구를 만들 수 있을까.
이해 확인
가중치 감쇠가 약할 때, 유효 표본 수가 차원 d에 가까워질수록 오차가 도리어 커지는 까닭은?
- 표본이 늘면 벌크 밖으로 튀어나오는 고유값이 줄어 놓친 특징이 많아지기 때문이다
- 튀어나온 고유값은 늘지만 벌크의 2차 모멘트, 곧 학습한 잡음이 커지기 때문이다
- 가중치 감쇠가 모든 고유값을 0으로 눌러 버리기 때문이다
- 최적화가 나쁜 국소 최솟값에 갇히기 때문이다
논문의 위상 V에서는 튀어나온 고유값이 계속 늘어 더 많은 특징을 배우지만, 모델이 보간에 가까워지면서 잡음을 외우고 벌크의 2차 모멘트가 커진다. 결과 3의 과적합 항이 이 모멘트라서 오차가 오른다. 논문은 전역 최솟값을 분석하므로 최적화 실패는 원인이 아니다.
논문 정보
- 제목: Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning Regime
- 저자: Leonardo Defilippis, Yizhou Xu, Julius Girardin, Emanuele Troiani, Vittorio Erba, Lenka Zdeborová, Bruno Loureiro, Florent Krzakala (EPFL, ENS)
- 학회: ICLR 2026 구두 발표(Oral)
- 링크: arXiv 2509.24882, OpenReview, 코드