은닉 차원보다 긴 기억을 RNN은 어떻게 겹쳐 담을까
시간 중첩과 간섭 없는 공간으로 읽는 RNN의 기억 전략
Temporal superposition and feature geometry of RNNs under memory demandsICLR 2026 Oral
3줄 요약
- 특징이 뉴런보다 많으면 신경망은 특징 방향을 조금씩 겹쳐 담는다. 이를 중첩(superposition)이라 한다. 이 논문은 같은 일이 시간 축에서도 일어난다는 것을 보인다. RNN은 같은 입력이라도 들어온 지 몇 스텝 됐는지에 따라 다른 방향에 담아야 해서, 오래 기억할수록 은닉 상태가 금세 비좁아진다.
- 선형 RNN의 기대 손실을 네 항으로 나누면 학습된 모양이 설명된다. 선형 RNN은 특징을 돌리면서 줄여 나선을 그리며 잊고, 출력에 ReLU가 붙으면 출력 방향 반대편 절반을 아무것도 잘못 읽히지 않는 “간섭 없는 공간”으로 쓴다.
- 입력이 드물어지면 기하가 조밀 국면에서 희소 국면으로 급격히 바뀐다. 담을 특징 수와 기억 길이가 함께 늘면 RNN은 가장 중요한 특징 하나만 끝까지 붙든다.
선정 이유
ICLR 2026에서 구두 발표(Oral)로 뽑혔고 리뷰 점수는 8, 8, 8, 6이었다. 블로그의 연구 여지 지도에서 이 논문이 속한 ’계산 신경과학과 신경 회로’는 LLM 중심 주제를 뺀 109개 주제 가운데 5위다. 초록에 “아직 잘 모른다”는 식의 표현이 나오는 비율(19%)은 LLM이 아닌 주제 중 가장 높다. 10월 두 번째 테마인 ’뇌 데이터와 계산 신경과학’의 첫 글로 고른 이유다.
- 전후로 아는 것이 달라졌나. 달라졌다. 지금까지 중첩은 특징 수가 차원보다 많을 때 생기는 공간의 문제로만 다뤄졌다. 이 논문은 기억 길이도 같은 압박을 만든다는 것을 보이고, 간섭을 투영 간섭과 조합 간섭 두 가지로 나눠 손실식으로 정리했다. 학습된 모양을 “이렇게 생겼다”에서 “그래서 이렇게 생긴다”로 설명할 수 있게 됐다.
- 새 질문을 여는가. 연다. 기억할 시점이 정해져 있지 않은 과제, 큰 순환 모델, 실제 뇌 기록에서 시간 중첩이 어떻게 나타나는지가 모두 열려 있다.
- 일반화될 근거가 있나. 부분적으로 있다. 이론은 선형 순환에서 정확하고, ReLU가 들어간 모델에서는 시뮬레이션으로 같은 경향을 확인했다. 은닉 차원 100, 특징 75개로 키운 실험도 더했다(부록 G). 다만 과제는 사실상 하나(k-지연 과제)다.
- 증거가 주장만큼 강한가. 이론이 예측한 손실은 실제 손실 곡선과 잘 겹친다(그림 2). 반면 은닉 차원이 2일 때는 최적화가 어려워, 모델 1,000개 가운데 예측한 모양에 도달한 비율이 비선형 RNN 기준 8.2~31.4%에 그친다(부록 I.1, 표 1). 본문 그림은 손실이 가장 낮은 모델을 골라 그렸다.
왜 중요한가
신경망 해석 연구에서 가장 골치 아픈 현상 가운데 하나가 다의성(polysemanticity)이다. 뉴런 하나가 서로 관계없는 여러 입력에 반응하는 현상이다. Elhage 외(2022)의 장난감 모델 연구는 이를 중첩 가설로 설명했다. 특징이 드물게 나타난다면 특징 수보다 적은 뉴런에 방향을 조금씩 겹쳐 담는 편이 이득이라는 설명이다. 그 뒤로 희소 오토인코더(sparse autoencoder)로 겹친 특징을 풀어내는 연구가 크게 늘었지만, 중첩이 만드는 기하 자체를 따진 연구는 상대적으로 적다(Sharkey 외, 2025).
순환 모델에는 피드포워드 모델에 없는 압박이 하나 더 있다. 시간이다. 지나간 입력을 은닉 상태에 담아 두어야 하고, 담아 둘 시간이 길수록 같은 차원에 넣어야 할 정보가 늘어난다. 이 문제는 두 분야에 동시에 걸려 있다. 머신러닝에서는 S4, LRU, Mamba처럼 선형 순환을 쓰는 모델이 긴 시퀀스를 효율적으로 다루는 대안으로 다시 주목받고 있다. 신경과학에서는 RNN이 동물의 신경 활동을 잘 재현해 인지 모델로 널리 쓰이고, 제한된 자원으로 정보를 잠시 붙드는 작업 기억(working memory)이 핵심 주제다. 이 논문은 두 분야에 같은 언어를 건넨다.
핵심 아이디어
직관: “무엇”과 함께 “언제”를 담는다
공간 중첩부터 보자. 입력 특징이 5개(A~E)이고 은닉 차원이 2개라면, 특징이 드물게 나타날 때는 다섯 방향을 오각형으로 펼쳐 담는 것이 최선이다(그림 1a). 가끔 두 특징이 함께 켜지면 서로 간섭하지만, 드물게 켜지는 특징이라면 그 손해보다 더 많은 특징을 담는 이득이 크다.
시간 중첩은 특징이 하나뿐이어도 생긴다(그림 1b). 입력 A가 들어오면 RNN은 스텝이 지날 때마다 A의 표현을 다른 방향으로 옮긴다. 방금 들어온 A와 다섯 스텝 전에 들어온 A는 같은 입력이지만 서로 다른 방향에 놓인다. 그래야 언제 들어왔는지를 구분해 제때 꺼낼 수 있다. 기억해야 할 기간이 은닉 차원보다 길어지면 RNN은 오래된 것을 잊거나 방향들을 겹쳐 담는 수밖에 없다. 논문은 이를 시간 중첩(temporal superposition)이라 부른다.
방법: k-지연 과제와 나이별 특징 방향
은닉 상태를 \(h_t = W_x x_t + W_h \sigma_h(h_{t-1})\), 출력을 \(\hat y_t = \sigma_y(W_y^\top h_t)\)로 두자(식 1). 순환이 선형이면 은닉 상태는 지나간 입력의 합으로 풀린다(식 3).
\[ h_t=\sum_{s=0}^{t-1} W_h^{s}W_x\,x_{t-s}=\sum_{s=0}^{t-1} w_s\,x_{t-s} \]
여기서 \(s\)는 입력이 RNN 안에 머문 스텝 수, 곧 입력의 나이다. 나이가 \(s\)인 입력은 방향 \(w_s\)에 담긴다. 과제는 k-지연 과제다(Jaeger, 2002). 입력 수열을 \(k\)스텝 늦게 그대로 내보내야 하므로(\(y_t=x_{t-k}\)) \(k\)가 기억 부담을 직접 조절한다. \(k=0\)이면 Elhage 외(2022)의 피드포워드 설정과 같아진다.
이 틀에서 간섭은 두 종류로 나뉜다(3.4절). 투영 간섭(projection interference)은 나이가 다른 방향이 출력 방향 \(w_y\)에 비스듬히 걸려, 엉뚱한 시점의 입력이 지금 꺼낼 입력처럼 읽히는 경우다. 조합 간섭(composition interference)은 동시에 켜진 두 입력의 방향을 더한 벡터가 마침 다른 나이의 방향을 흉내 내는 경우다. 들어온 적 없는 입력이 들어온 것처럼 보이게 된다.
(가) 3-지연 과제와 입력의 나이
(나) 나이별 방향이 그리는 나선
수식: 손실을 네 항으로 나누면
입력이 확률 \(p\)로 드물게 켜지고 시점끼리 독립이라고 가정하면, 선형 RNN의 기대 손실은 네 항으로 정리된다(식 5, 부록 B). \(\mu\)와 \(\nu\)는 켜진 입력 값의 평균과 제곱 평균이다.
\[ \mathbb{E}[L]=\sum_{t=k+1}^{T}\Big(\underbrace{p\nu\,(w_y^\top w_{k}-1)^2}_{\text{task}}\underbrace{-\,2p^2\mu^2\sum_{s\neq k}w_y^\top w_s}_{\text{mean}}\Big)+\sum_{t=1}^{T}\Big(\underbrace{p\nu\sum_{s\neq k}(w_y^\top w_s)^2}_{\text{projection}}+\underbrace{p^2\mu^2\sum_{s\neq s'}(w_y^\top w_s)(w_y^\top w_{s'})}_{\text{composition}}\Big) \]
첫 항(과제 이득)은 \(k\)스텝 된 입력의 방향 \(w_k\)를 출력 방향에 맞출수록 줄어든다. 둘째 항(평균 보정)은 입력 평균이 0이 아닐 때 다른 방향의 투영을 편향처럼 쓰는 효과인데, 출력에 편향을 두면 사라진다. 셋째 항(투영 간섭 비용)은 제때가 아닌 방향이 출력에 걸리는 만큼 벌을 준다. 넷째 항(조합 간섭)은 투영이 같은 부호끼리 겹치면 벌을, 반대 부호끼리 상쇄하면 이득을 준다. 그래서 방향들은 가능한 한 서로 멀리, 이상적으로는 정반대 쌍을 이루도록 퍼지려 한다.
선형 RNN이 실제로 찾는 답은 나선 수렴(spiral sink)이다(위 개념도의 (나)). 매 스텝 특징을 조금씩 돌리면서 크기를 줄여, 오래된 입력이 원점으로 말려 들어가며 사라진다(4.1절). 부록 D는 손실이 유한하려면 스펙트럼 반경이 1보다 작아야 함을 증명하고, 나선이 최적이라는 것은 2차원에서 실험으로 확인한다. 논문은 이를 부드러운 망각이라 부른다.
출력에 ReLU를 붙이면 사정이 달라진다(식 6). 출력 방향과 반대쪽을 향한 벡터는 ReLU를 지나면 0이 되므로, 출력 방향 반대편 절반은 아무것도 잘못 읽히지 않는 간섭 없는 공간(interference-free space)이 된다. 입력이 충분히 드물어 조합 간섭을 무시할 수 있다면, 아직 꺼낼 때가 되지 않은 방향들을 모두 이 반쪽에 몰아 두는 것이 최선이다(그림 3a).
결과 해설
학습은 두 단계로 진행된다(그림 2). 2차원 선형 RNN을 3-지연 과제로 학습시키면, 처음에는 모든 나이의 방향이 출력 방향 쪽으로 한꺼번에 정렬된다. 그다음 방향들이 나이 순서대로 벌어지면서 과제 오차, 평균 보정, 조합 간섭 항은 줄고 투영 간섭 항은 커진다. 손실 곡선이 계단 모양으로 떨어지는데, 저자들은 이를 특이값을 하나씩 배우며 안장점 사이를 옮겨 가는 학습(saddle-to-saddle dynamics)의 흔적으로 본다. 식 5로 계산한 기대 손실은 실제 손실 곡선과 잘 겹친다.
입력이 드물어지면 모양이 급변한다(4.3절, 그림 4). 순환은 선형이고 출력에만 ReLU가 있는 상태공간모델(SSM)을 보자. 입력이 자주 켜지는 조밀 국면에서는 선형 RNN처럼 나선으로 수렴하고, 과제에 필요한 방향들이 약 90도 안에 모인다. 입력이 드문 희소 국면에서는 방향들이 약 270도에 걸쳐 퍼지며 간섭 없는 공간을 가로질러 출력 방향에 닿는다. 희소도를 바꾸면 이 각도가 급격히 뛰는 상전이가 나타나고, 스펙트럼 반경은 함께 줄어든다. 조밀 국면에서 간섭 없는 공간을 쓰지 않는 이유를 저자들은 조합 간섭 때문으로 추정한다. 반대편에 숨겨 둔 큰 방향과 출력 쪽의 작은 방향이 동시에 켜지면, 둘이 상쇄되어 출력이 0으로 잘려 버릴 수 있어서다.
비선형 RNN은 간섭 없는 공간을 제대로 쓴다(4.4절, 그림 3d). 순환에도 ReLU를 넣으면, 아직 꺼낼 때가 되지 않은 방향들을 모두 간섭 없는 공간에 몰아넣고 꺼낼 차례인 방향만 바깥에 둔다. ReLU가 음수를 0으로 만들기 때문에 방향들은 은닉 상태의 양수 사분면 하나에 모이는 경우가 많다. 더 흥미로운 차이는 망각 방식이다. 선형 순환은 크기를 조금씩 줄여 잊는 수밖에 없지만, 비선형 RNN은 쓸모없어진 특징을 음수 사분면으로 보내 한 번에 지운다. 논문은 이를 날카로운 망각이라 부른다.
특징 수와 기억 길이는 서로를 밀어낸다(4.5절, 그림 5). 중요도가 다른 특징 5개(A가 가장 중요)를 은닉 차원 2에 담게 하면, \(k=0\)에서는 다섯 개가 오각형으로 모두 담긴다. \(k=1\)이 되면 A, B, C만 두 스텝 동안 담고 D와 E는 버린다. \(k\)가 더 커지면 A 하나만 남는다. 어떤 특징이 손실을 줄이려면 \(k+1\)스텝 내내 붙들려 있어야 하므로, 그럴 여력이 없는 특징은 아예 담지 않는다. 저자들은 이를 전부 아니면 전무(all-or-none) 전략이라 부른다. 은닉 차원 100, 특징 75개로 키운 2-지연 과제 실험에서도 성능이 좋은 모델은 꺼낼 차례가 아닌 큰 방향들을 간섭 없는 공간에 두고, 제때 꺼낼 방향만 출력에 맞췄다(그림 13, 부록 G).
의심해볼 점
- 과제가 하나다. 핵심 결과는 모두 k-지연 과제, 곧 입력을 정해진 스텝 뒤에 그대로 되돌려 주는 과제에서 나왔다. 기억할 시간이 매번 달라지거나 기억한 정보를 가공해야 하는 과제에서는 전략이 달라질 가능성이 크다. 저자들이 더한 무작위 지연 실험(부록 H)에서는 방향들이 나선 대신 원점으로 줄어드는 직선 위에 놓이고, 주된 방향이 2~3개로 뭉치는 경우가 많았다. 저자들도 예비 결과라고 선을 긋는다.
- 그림은 가장 잘 된 모델이다. 은닉 차원 2는 경사하강법으로 최적화하기 어렵다. 조건별로 모델 1,000개를 학습시켰을 때 예측한 모양에 도달한 비율은 선형 RNN 11.4~30.8%, SSM 20.6~53.5%, 비선형 RNN 8.2~31.4%였다(부록 I.1, 표 1). Elhage 외(2022)도 같은 이유로 여러 번 학습해 가장 좋은 해를 골랐다.
- 정확한 이론은 선형 순환까지다. ReLU가 들어간 모델의 결과는 희소도가 매우 높은 극한의 근사식과 시뮬레이션에 기댄다. 입력이 시점끼리 독립이고 드물다는 가정도 과제에 따라서는 강할 수 있다고 저자들이 직접 적었다(6절).
- 선형 표현 가설을 전제한다. 특징이 활성 공간의 방향으로 표현된다는 가정이 무너지면 이 틀도 그대로 쓰기 어렵다.
리뷰어들이 짚은 점
ICLR 2026 심사 기록은 OpenReview에 공개돼 있다. 리뷰어 세 명이 8점, 한 명이 6점을 줬고 구두 발표로 채택됐다.
- 고정 지연 과제의 한계. 한 리뷰어는 여기서 보인 회전하는 동역학이 신경과학에서 이미 알려진 결과와 맞닿아 있다고 짚었다. 고정 지연으로 학습한 RNN은 제때 출력 자리에 닿도록 회전하지만, 무작위 지연으로 학습하면 안정된 고정점에 정보를 붙든다는 지적이다. 그렇다면 시간 중첩은 고정 지연 과제가 만든 현상일 수도 있다. 저자들은 무작위 지연 실험(부록 H)을 더해 답했다.
- 모델 크기와 보고의 엄밀성. 다른 리뷰어는 2차원 RNN만으로는 일반화된 교훈을 얻기 어렵고, 모델 가운데 몇 개가 예측한 모양에 실제로 도달했는지 밝혀야 한다고 했다. 표 1과 은닉 차원 100 실험이 이 지적에 대한 답이다. 같은 리뷰어는 저차원 순환망(low-rank RNN) 연구가 이미 학습된 흐름 지도까지 정확히 그려 낸다며, 그 흐름과의 관계를 분명히 하라고 요구했다.
- 실용적 의미. 시간 중첩이 학습이나 평가에 무엇을 바꾸느냐는 질문에, 저자들은 데이터의 희소도로 RNN이 택할 전략과 필요한 모델 크기를 예측하고, 특징을 헷갈리거나 엉뚱한 시점에 내보내는 오류를 두 간섭으로 설명할 수 있다고 답했다.
- 동물 데이터와 층. 동물 데이터에서 시간 중첩을 본 적이 있느냐는 질문에 저자들은 조심스럽게 답했다. 원숭이 전전두엽에서 순서 항목들이 서로 다른 신경 부분공간에 담긴다는 결과(Xie 외, 2022)는 닮았지만, 그 부분공간들은 거의 직교해 중첩과는 다르다는 설명이다. 피드포워드 신경망의 층을 시간처럼 볼 수 있느냐는 질문에는 비슷한 현상이 생길 수 있지만, 시점마다 입력과 출력이 따로 있다는 점이 핵심 차이라고 답했다.
계보
- Elhage 외(2022), Toy Models of Superposition. 출발점이다. 이 논문에서 \(k=0\)인 경우가 곧 이 피드포워드 장난감 모델이다.
- 중첩의 상전이. Chen 외(2023)는 같은 장난감 모델에서 은닉 차원이 2일 때 정다각형 해들이 임계점이 되고, 학습이 이 점들 사이를 옮겨 가며 진행된다는 것을 보였다. 이번 논문의 조밀 국면과 희소 국면 사이 상전이는 같은 그림을 시간 축에서 본 사례로 읽을 수 있다(블로그의 해석).
- 선형 RNN의 기억. Jaeger(2002)의 에코 상태 네트워크 기억 용량 연구가 k-지연 과제의 원형이다. François, Orvieto, Bach(2025)는 차원이 \(S\)인 선형 RNN이 그보다 먼 \(K\)스텝 전 입력을 흉내 낼 때, 최적 필터가 \(K\)스텝 근처를 \(K/S\)에 비례하는 폭으로 뭉개 평균낼 수밖에 없음을 보였다. 이번 논문은 그 조밀 국면에 더해 희소 국면과 비선형 RNN까지 다룬다.
- 학습 동역학. 같은 그룹의 Proca 외(2025)는 선형 RNN의 학습 동역학을, Haputhanthri 외(2024)는 단기 기억 과제에서 RNN이 어느 순간 갑자기 배우는 분기 현상을 다뤘다.
- 신경과학. 고정 지연에서의 회전 동역학과 무작위 지연에서의 고정점(Orhan과 Ma, 2019), 원숭이 전전두엽의 순서 기억 기하(Xie 외, 2022), 운동을 준비하는 활동이 출력에는 영향을 주지 않는 부분공간(Schimel 외, 2024)이 가까운 연구다. 작업 기억 이론의 두 갈래인 슬롯 모델과 자원 모델에 대해, 저자들은 이 설정에서 둘이 함께 나타난다고 본다(5절).
- 후속. 공저자 Prieto와 Mediano가 참여한 후속 연구(Prieto 외, 2026)는 특징들이 서로 상관될 때 이상화된 중첩 설명이 어떻게 달라지는지를 다룬다.
열린 질문
- 기억할 시점이 매번 다르거나 기억한 정보를 가공해야 하는 과제에서, 시간 중첩은 어떤 기하로 바뀌는가.
- 수백 차원 이상의 현대 순환 모델에서도 간섭 없는 공간과 나이별 방향을 직접 재고 풀어낼 수 있는가.
- 뇌에서 기억해야 할 항목이 용량을 넘어서면, 항목별 신경 부분공간이 서로 겹치기 시작하는가.
이해 확인
1. 투영 간섭과 조합 간섭을 바르게 설명한 것은?
- 투영 간섭은 두 입력이 동시에 켜질 때, 조합 간섭은 다른 나이의 방향이 출력에 걸릴 때 생긴다
- 투영 간섭은 꺼낼 때가 아닌 나이의 방향이 출력 방향에 비스듬히 걸려 엉뚱한 시점이 읽히는 오류이고, 조합 간섭은 동시에 켜진 방향들의 합이 다른 방향을 흉내 내는 오류다
- 둘 다 은닉 차원이 특징 수보다 클 때만 생긴다
- 투영 간섭은 ReLU 출력에서만, 조합 간섭은 선형 출력에서만 생긴다
투영 간섭은 w_s(s ≠ k)가 출력 방향 w_y와 직교하지 않아 생기고, 조합 간섭은 w_A + w_B 같은 합이 제3의 방향과 비슷해져 생긴다. 출력에 ReLU가 붙으면 w_y 반대편 절반에 둔 방향은 출력을 만들지 않아 투영 간섭이 줄어든다.
2. 선형 순환 RNN은 오래된 입력을 어떻게 지우나?
- 쓸모없어진 특징을 음수 사분면으로 보내 한 번에 지운다
- 같은 행렬을 거듭 곱하며 돌리고 줄여서, 나선을 그리며 원점으로 서서히 사라지게 한다
- 은닉 상태를 주기적으로 0으로 되돌린다
- 출력 방향과 같은 방향에 모아 둔다
선형 순환에서는 w_s = W_h^s W_x라서 입력이 나이 들수록 같은 행렬이 곱해질 뿐이다. 지우는 방법은 크기를 조금씩 줄이는 것뿐이고, 긴 수열에서도 손실이 유한하려면 스펙트럼 반경이 1보다 작아야 한다. 음수 사분면으로 보내 한 번에 지우는 날카로운 망각은 순환에 ReLU가 있는 RNN만 할 수 있다.
3. 은닉 차원 2에 중요도가 다른 특징 5개를 담게 하고 기억 길이 k를 늘리면 가장 중요한 A 하나만 남는다. 까닭은?
- 특징 A가 입력으로 가장 자주 들어오기 때문이다
- 한 특징이 손실을 줄이려면 k + 1스텝 내내 붙들려 있어야 해서, 여력이 모자라면 가장 중요한 특징 하나에 몰아주는 편이 낫기 때문이다
- k가 커지면 조합 간섭이 사라지기 때문이다
- 스펙트럼 반경이 1을 넘어서기 때문이다
k-지연 과제에서 한 특징은 들어온 순간부터 k스텝 뒤 출력될 때까지 k + 1개의 나이별 방향이 모두 유지되어야 쓸모가 있다. 중간에 하나라도 잃으면 이득이 거의 없어서, 은닉 차원이 모자라면 여러 특징을 조금씩 담기보다 A 하나를 끝까지 담는다.
논문 정보
- 제목: Temporal superposition and feature geometry of RNNs under memory demands
- 저자: Pratyaksh Sharma, Alexandra M. Proca, Lucas Prieto, Pedro A. M. Mediano (Imperial College London. Mediano는 University College London 겸임)
- 학회: ICLR 2026 Oral
- 링크: OpenReview, ICLR 논문집 PDF, 코드

