LLM 논문이 절반에 가까워진 학회에서, 연구할 틈은 어디에 남았을까
ICLR, ICML, NeurIPS 5년치 논문 7만 8,679편으로 그린 연구 여지 지도 (2026년 9월판)
한눈에
- ICLR, ICML, NeurIPS의 2022~2026년 논문 7만 8,679편(채택작 4만 4,460편)을 제목과 초록의 뜻에 따라 150개 주제로 묶었다.
- 채택작 가운데 초록에 LLM 관련 표현을 쓴 논문은 2022년 3.9%에서 2026년 45.2%로 늘었다. 150개 주제 중 41개가 LLM 중심 주제였다.
- 나머지 109개 주제에 성장, 리뷰어 평가, 미해결 문제, 진입 장벽, 혼잡도를 합친 여지 점수를 매겼다. 1위부터 차례로 MCMC와 신경 샘플러, 온라인 학습 이론, 플로우 매칭과 정규화 플로우, 메커니즘 설계, 계산 신경과학이다.
- 이 다섯 주제는 가중치를 무작위로 2,000번 바꿔도 76~97%의 경우 상위 10위에 남았다. 상위 10개 주제에서 초록에 대규모 연산 표현이 나오는 논문은 많아야 7.3%다.
왜 이 지도를 그렸나
이 블로그는 논문을 화제성보다 연구 가치로 고른다. 매달 테마를 정할 때도 같은 기준이 필요하다. 어느 주제에 관심이 모이는지, 어디에 아직 풀리지 않은 문제가 많은지, 어디라면 GPU 몇 장으로도 의미 있는 연구를 할 수 있는지 한눈에 보고 싶었다. 감으로 고르면 결국 요즘 가장 자주 보이는 주제를 고르게 되고, 요즘 가장 자주 보이는 주제는 LLM이다.
그래서 세 학회 5년치 논문으로 지도를 그렸다. 이 지도가 재는 것은 주제의 중요도가 아니라 들어갈 틈이다. 오래되고 중요한 분야라도 이미 붐비고 방법이 성숙했다면 점수가 낮게 나온다. 점수가 높다고 더 중요한 주제라는 뜻도 아니다.
LLM 중심 주제는 순위에서 뺐다. LLM 연구의 가치가 낮아서가 아니다. 붐비는 곳 바깥에서 틈을 찾는 것이 이 지도의 목적이고, 이 블로그는 LLM과 에이전트 논문을 일주일에 한 편 이하로 다루기로 했다. 뺀 주제도 흐름을 비교할 때 쓰고, 아래 조절기와 주제별 수치 파일에서는 함께 볼 수 있다.
데이터와 방법
자료
Paper Copilot이 OpenReview와 학회 공식 페이지에서 모아 공개한 논문 목록(paperlists)을 썼다. ICLR은 2022~2026년 투고작 전체를, ICML은 2022~2026년 채택작을, NeurIPS는 2022~2025년 채택작을 넣었다. 모두 본 트랙만 셌고 초록이 없는 항목은 뺐다. 합치면 7만 8,679편이고, 그중 채택작은 4만 4,460편(ICLR 1만 3,991편, ICML 1만 5,270편, NeurIPS 1만 5,199편)이다. 탈락작은 주제를 묶을 때와 ICLR 채택률을 비교할 때만 썼고, 지표는 모두 채택작으로 계산했다. NeurIPS 2026 채택작은 목록이 공개되면 다음 판에 넣는다.
수집본이 원본과 맞는지 보려고 ICLR 2024~2026, ICML 2026, NeurIPS 2025에서 무작위로 50편을 골라 OpenReview와 대조했다. 50편 모두 제목과 채택 여부가 같았다.
주제 묶기
제목과 초록을 문장 임베딩 모델(BAAI/bge-small-en-v1.5)로 벡터로 바꾸고 k-평균(k-means)으로 150개 묶음을 만들었다. 묶음마다 다른 묶음과 구별되는 단어, 저자 키워드, 대표 논문 제목을 보고 이름을 붙였다. 연구 대상이 LLM이나 시각 언어 모델(VLM), LLM 기반 에이전트인 묶음 41개는 LLM 중심 주제로 표시했다.
여지 점수
주제마다 다섯 지표를 쟀다(표 1).
| 지표 | 무엇을 보나 | 어떻게 쟀나 | 가중치 |
|---|---|---|---|
| 상대 성장률 | 관심이 느는가 | LLM 중심 주제를 뺀 채택작 안에서 이 주제가 차지하는 비율이 해마다 변한 정도. 2023~2026년, 학회 차이를 보정한 포아송 회귀 | 30% |
| 리뷰어 평가 | 학계가 가치 있게 보는가 | 유의성, 독창성 같은 리뷰어 점수를 학회와 연도별로 표준화한 평균, 그리고 oral과 spotlight 비율. 두 백분위의 평균 | 20% |
| 미해결 표현 | 열린 문제가 많은가 | 초록에 “아직 잘 이해되지 않았다”, “처음으로” 같은 표현이 나오는 논문의 비율 | 15% |
| 낮은 진입 장벽 | 작은 자원으로 할 수 있는가 | 초록에 수십억 파라미터, 대규모 사전학습, 실제 로봇 실험 같은 표현이 나오는 논문의 비율. 낮을수록 좋다 | 25% |
| 덜 붐빔 | 아직 덜 붐비는가 | 2025~2026년 채택작 가운데 이 주제의 점유율. 낮을수록 좋다 | 10% |
각 지표를 LLM 중심 주제를 뺀 109개 주제 안의 백분위로 바꾼 뒤 가중합했다. 점수는 0과 1 사이이고 높을수록 여지가 크다. 진입 장벽에 두 번째로 큰 가중치를 준 것은 GPU 몇 장으로 연구하는 사람을 기준으로 삼았기 때문이다. 연산 자원이 넉넉하다면 아래 조절기에서 이 가중치를 내려 보면 된다.
성장률을 전체 채택작이 아니라 LLM 중심 주제를 뺀 나머지와 견준 데는 이유가 있다. LLM 논문이 워낙 빨리 늘어서, 전체와 견주면 거의 모든 주제가 쪼그라드는 것처럼 보인다. 나머지 주제 안에서 비중이 느는지를 봐야 관심이 어디로 옮겨 가는지 드러난다.
흐름: 채택작 두 편 중 한 편 가까이가 LLM
초록에 LLM 관련 표현을 쓴 채택작은 2022년 3.9%에서 2024년 23.5%, 2026년 45.2%로 늘었다(그림 1). ICLR 투고작도 4.2%에서 46.8%로 같은 길을 걸었다. LLM 중심 주제를 뺀 채택작의 비중은 ICLR에서 90.0%에서 57.5%로, ICML에서 94.6%에서 61.7%로(2022~2026년), NeurIPS에서 91.7%에서 71.1%로(2022~2025년) 줄었다. 2023년 이후 추세로 보면 해마다 약 12%씩 줄어든 셈이다.
심사가 이 쏠림을 누그러뜨리지도 않았다. 2024~2026년 ICLR에서 LLM 중심 주제의 채택률은 30.2%(1만 3,569편 중)로, 나머지 주제의 28.5%(2만 5,320편 중)보다 오히려 조금 높았다.
LLM 중심 주제는 연산 부담도 크다. 초록에 대규모 연산 표현이 나오는 논문의 비율을 주제별로 구해 중앙값을 보면 LLM 중심 주제가 17.1%, 나머지 주제가 6.1%다. 블로그의 해석: 많은 연구진이 같은 문제를 큰 연산으로 푸는 곳에서 작은 연구실이 속도로 겨루기는 어렵다. 이 지도가 LLM 바깥을 들여다보는 이유다.
지도
그림을 옆으로 밀면 오른쪽 주제까지 보인다.
그림 2는 109개 주제를 상대 성장률과 대규모 연산 표현 비율로 펼친 것이다. 오른쪽으로 갈수록 LLM 바깥에서 관심이 빨리 늘고, 아래로 갈수록 초록에 큰 연산을 드러내는 표현이 적다. 오른쪽 아래가 작은 자원으로 들어가기 좋은 쪽이다.
109개 가운데 50개 주제가 LLM 바깥 전체보다 빨리 컸다. 하지만 LLM까지 포함한 전체 채택작에서 비중이 늘어난 주제는 34개뿐이다. LLM 바깥에서 크고 있다는 말이 곧 전체에서 크고 있다는 뜻은 아니다.
빨리 크지만 순위는 높지 않은 주제도 눈여겨볼 만하다. 자기회귀 이미지 생성(18위)은 상대 성장률이 연 140%로 109개 중 가장 빠르지만, 초록에 대규모 연산 표현이 나오는 논문이 15.9%다. EEG, fMRI 뇌 디코딩(22위)도 연 60%로 빠르게 크지만 그 비율이 22.9%다. 확산 모델 이론과 샘플링(16위)은 연 24%로 크고 연산 부담도 3.9%로 작지만, 이미 LLM 바깥에서 가장 붐비는 주제라 덜 붐빔 점수가 꼴찌다.
상위 주제
| 순위 | 주제 | 여지 점수 | 상대 성장률 | 대규모 연산 표현 | 상위 10위 유지 |
|---|---|---|---|---|---|
| 1 | MCMC와 신경 샘플러 | 0.73 | +18% | 1.5% | 97% |
| 2 | 온라인 학습 이론 | 0.71 | -11% | 0.8% | 89% |
| 3 | 플로우 매칭과 정규화 플로우 | 0.69 | +70% | 3.3% | 79% |
| 4 | 메커니즘 설계, 시장과 경매 | 0.68 | +4% | 2.2% | 82% |
| 5 | 계산 신경과학과 신경 회로 | 0.67 | -1% | 3.3% | 76% |
| 6 | 딥페이크 탐지와 얼굴 인식 | 0.65 | +73% | 6.6% | 58% |
| 7 | 게임 이론과 내쉬 균형 학습 | 0.65 | -24% | 1.2% | 58% |
| 8 | SGD 수렴 이론 | 0.64 | -16% | 0.8% | 47% |
| 9 | 인간 모션 생성과 애니메이션 | 0.63 | +53% | 7.3% | 46% |
| 10 | 인과 표현 학습과 식별성 | 0.63 | -16% | 0.8% | 44% |
상위 10개는 두 갈래로 나뉜다(표 2). 절반은 LLM 바깥 전체보다 빨리 크는 주제이고, 나머지 절반은 비중은 줄지만 리뷰어 평가가 높고 연산 부담이 작은 주제다. 10개 가운데 8개는 대규모 연산 표현 비율이 109개 주제의 중앙값(6.1%)보다 낮고, 가장 높은 인간 모션 생성도 7.3%다. 상위 5개 주제는 2024~2026년 ICLR 채택률이 32.8~45.9%로, 같은 기간 ICLR 전체 채택률 29.1%보다 높았다.
1~5위: 가중치를 흔들어도 남는 곳
1위 MCMC와 신경 샘플러. LLM 바깥 전체보다 해마다 18%씩 빨리 크고, 대규모 연산 표현은 1.5%에 그친다. 리뷰어 평가 백분위는 91이다. 대표 논문을 보면 볼츠만 분포처럼 정규화 상수를 모르는 분포에서 신경망으로 표본을 뽑는 연구(“Autoregressive Boltzmann Generators”, ICML 2026 spotlight)와 로그 오목 분포 샘플링의 이산화 오차를 줄이는 연구(“Poisson Midpoint Method for Log Concave Sampling”, ICLR 2026)가 함께 있다.
2위 온라인 학습 이론. 비중은 LLM 바깥 전체보다 해마다 11%씩 줄지만, 리뷰어 평가 백분위가 92로 높고 대규모 연산 표현은 0.8%로 거의 없다. 초록의 11.0%에 미해결 표현이 나온다. 경쟁이 적고 증명으로 기여할 수 있는 틈새다. NeurIPS 2025 oral인 “Optimal Mistake Bounds for Transductive Online Learning”이 이 주제에 속한다.
3위 플로우 매칭과 정규화 플로우. LLM 바깥 전체보다 해마다 70%씩 빨리 크고 있고, 2026년 ICLR에는 이 주제로 139편이 투고됐다. 연속 공간에서 시작한 틀이 이산 경로(“Flow Matching with General Discrete Paths”, ICLR 2025 oral)와 임의의 마르코프 과정(“Generator Matching”, ICLR 2025 oral)으로 넓어지고 있다.
4위 메커니즘 설계, 시장과 경매. ML과 경제학이 만나는 곳이다. 성장은 LLM 바깥 전체보다 조금 빠른 정도(연 4%)지만 리뷰어 평가 백분위가 84이고 대규모 연산 표현은 2.2%다. 예측을 기다리는 비용(“The Hidden Cost of Waiting for Accurate Predictions”, ICLR 2025 oral)이나 LLM으로 사회적 학습을 이끄는 문제(“Steering the Herd”, ICLR 2026 oral)처럼 새 질문이 들어오고 있다.
5위 계산 신경과학과 신경 회로. 초록에 미해결 표현이 나오는 비율이 19.1%로 109개 주제 가운데 가장 높고, 리뷰어 평가 백분위도 88이다. 뇌 데이터와 모델을 잇는 문제가 넓게 열려 있다는 뜻으로 읽힌다. NeurIPS 2025 spotlight인 “Vector Quantization in the Brain: Grid-like Codes in World Models”가 이 주제에 속한다.
6~10위: 무엇을 중시하느냐에 따라 바뀌는 곳
6~10위는 가중치를 무작위로 바꿨을 때 상위 10위에 남은 비율이 44~58%다.
- 딥페이크 탐지와 얼굴 인식(6위)은 연 73%로 빠르게 크지만, 2024~2026년 ICLR 채택률은 16.3%로 전체(29.1%)보다 한참 낮다. 투고는 몰리는데 통과는 어렵다. 얼굴 인식과 인물 재식별이 한 묶음에 섞여 있어 경계도 흐리다.
- 게임 이론과 내쉬 균형 학습(7위)은 리뷰어 평가 백분위가 91이고 대규모 연산 표현이 1.2%지만, 비중이 해마다 24%씩 줄고 있다.
- SGD 수렴 이론(8위)은 비중이 해마다 16%씩 줄지만 초록의 12.9%에 미해결 표현이 나오고 대규모 연산 표현은 0.8%다.
- 인간 모션 생성과 애니메이션(9위)은 연 53%로 크고 있다. 음성에 맞춰 움직이는 아바타와 제스처 생성으로 응용이 넓어지는 중이다.
- 인과 표현 학습과 식별성(10위)은 2025~2026년 채택작 점유율이 0.26%로 상위 10개 가운데 가장 덜 붐빈다.
여지가 작은 곳
하위 10개에는 이미지 분할, 연합학습, 퓨샷 분류, 모델 병합, 도메인 적응, 프루닝, 객체 탐지 같은 기법 분야가 몰려 있다. 10개 모두 LLM 바깥 전체보다 비중이 줄거나 제자리이고, 8개는 리뷰어 평가 백분위가 50보다 낮다. 연구할 가치가 없다는 뜻은 아니다. 블로그의 해석: 방법이 성숙해서 기존 방법을 조금 바꾸는 정도로는 새 기여를 보이기 어려운 곳이다.
이 지도를 얼마나 믿을까
가중치를 흔들어 보기
가중치는 판단이다. 그래서 기본 가중치 근처에서 디리클레 분포로 가중치를 2,000번 뽑아 순위를 다시 매겼다. 상위 5개는 76~97%의 경우 상위 10위에 남았고, 6~10위는 44~58%였다.
극단적인 설정도 따로 봤다. 가중치를 모두 20%로 똑같이 두면 상위 10개 가운데 6개가 그대로 남는다. 진입 장벽 가중치를 0으로 두면 5개, 성장률을 50%로 올리면 5개, 리뷰어 평가를 40%로 올리면 7개가 남는다. LLM 중심 주제까지 순위에 넣으면 LLM과 VLM의 환각 탐지, LLM 에이전트 보안, LLM으로 사람의 행동을 시뮬레이션하는 연구, 사고 사슬 추론이 상위 10위에 들어온다.
가중치를 직접 바꿔 볼 수 있게 조절기를 붙였다. 자기 조건에 맞게 가중치를 바꾸면 순위가 바로 다시 계산된다.
| 순위 | 주제 | 점수 | 기본 순위 |
|---|
점수는 다섯 지표 백분위의 가중합을 가중치 합으로 나눈 값이다. 검색하지 않으면 상위 12개를 보여 준다. LLM 중심 주제를 넣으면 150개 전체 안의 백분위를 쓴다.
한계
- 근사 지표. 미해결 표현과 진입 장벽은 초록에 쓰인 표현을 정규식으로 센 값이다. 초록에 쓰지 않은 사정, 예를 들어 실제로 쓴 GPU 규모는 잡지 못한다. 거꾸로 과대평가하기도 한다. EEG, fMRI 뇌 디코딩에서 대규모 연산 표현으로 잡힌 61편 가운데 46편은 초록에 “파운데이션 모델”이라는 말이 있어서 잡혔다. 파운데이션 모델을 가져다 쓴 논문이 모두 큰 연산을 쓰지는 않는다.
- 채택작 기준. ICML과 NeurIPS는 채택작만 있어서 성장률은 받아들여진 연구의 성장이다. 투고가 몰리는 정도와는 다를 수 있다.
- 주제 경계. k-평균을 한 번 돌린 결과다. 경계가 흐린 주제는 설정을 바꾸면 합쳐지거나 쪼개질 수 있다. 딥페이크 탐지와 얼굴 인식처럼 성격이 다른 연구가 한 묶음에 들어간 경우도 있다.
- 2026년은 반쪽. NeurIPS 2026이 빠져 있어서 2026년 수치는 ICLR과 ICML만 반영한다.
- 여지와 중요도는 다르다. 점수는 들어갈 틈을 잰다. 오래되고 중요한 분야도 점수가 낮게 나올 수 있다.
블로그는 이 지도를 이렇게 쓴다
10월 테마는 “샘플링과 생성 모델의 수학”이다. 1위 MCMC와 신경 샘플러, 3위 플로우 매칭과 정규화 플로우, 16위 확산 모델 이론과 샘플링을 한데 묶었다. 16위 주제는 붐벼서 순위가 내려갔지만, ICML 2026 본 트랙 수상작 7편 가운데 두 편(최우수 논문 1편, 우수 논문 가작 1편)이 이 주제에서 나왔다. 수상작이 두 편 나온 주제는 여기뿐이다. 세 주제 모두 대규모 연산 표현이 4% 아래라서, 증명과 작은 실험으로 기여할 여지가 크다는 점도 함께 봤다.
다음 테마 후보는 뇌 데이터와 계산 신경과학(5위, 22위), 그리고 덜 붐비는 학습 이론(2위, 7위, 8위)이다. 지도는 학회 시즌마다 다시 그린다. 다음 판에는 NeurIPS 2026 채택작과 ICLR 2027 투고작을 함께 넣는다. 두 목록이 모두 공개되는 11월쯤이 될 것이다.
열린 질문
- 진입 장벽을 초록의 표현이 아니라 실제 연산량으로 잴 수 있을까. NeurIPS 논문 체크리스트의 연산 자원 항목처럼 본문에 적힌 정보를 모으면 지표가 훨씬 정확해질 것이다.
- 여지 점수가 높았던 주제는 몇 년 뒤 실제로 좋은 연구를 낳았을까. 2022~2024년 자료만으로 점수를 매긴 뒤 2025~2026년의 수상작, oral 비율과 맞춰 보는 되짚기가 필요하다.
- LLM은 다른 주제의 연구 방식을 얼마나 바꾸고 있을까. 메커니즘 설계 주제에서도 초록의 7.3%에 LLM 관련 표현이 나온다. 주제 경계가 흐려지는 속도를 재는 방법이 있어야 한다.
자료와 재현
- 원자료: Paper Copilot paperlists. 2026년 9월 23일에 내려받았고, 저장소의 마지막 갱신은 2026년 7월 1일이다.
- 범위: ICLR 2022~2026 투고작 전체, ICML 2022~2026 채택작, NeurIPS 2022~2025 채택작, 본 트랙. 7만 8,679편, 채택작 4만 4,460편.
- 원본 대조: ICLR 2024~2026, ICML 2026, NeurIPS 2025에서 무작위 50편을 OpenReview와 대조해 제목과 채택 여부가 모두 같음을 확인했다(2026년 9월 23일).
- 방법: 제목과 초록 임베딩은 BAAI/bge-small-en-v1.5(최대 256토큰), 주제 묶기는 k-평균 150개(시드 7), 성장률은 학회 고정효과를 넣은 포아송 회귀, 가중치 민감도는 디리클레 분포에서 2,000번 추출.
- 주제별 수치: CSV 파일. 150개 주제의 순위, 다섯 지표의 원값과 백분위, 가중치 민감도를 담았다.