되돌아올 수 있어야 확률을 잴 수 있다

몇 걸음짜리 흐름 모델에 가역성 벌점을 더해, 볼츠만 생성기의 확률 계산을 백 배 가까이 빠르게 만든 ICLR 2026 구두 발표 논문

FALCON: Few-step Accurate Likelihoods for Continuous FlowsICLR 2026 Oral

ML 논문
생성 모델
볼츠만 생성기
흐름 매칭 모델은 표본 하나의 확률을 재는 데 수백 번의 계산이 든다. 몇 걸음에 건너뛰는 흐름 사상에 ‘갔다가 되돌아오면 제자리’ 벌점을 더해 이 비용을 줄이고 분자 평형 분포 샘플링에 쓴 FALCON을 읽는다.
공개

2026년 10월 2일

3줄 요약

  • 볼츠만 생성기(Boltzmann generator)는 생성 모델이 뽑은 분자 구조마다 에너지로 가중치를 매겨 열평형 분포를 정확히 맞춘다. 가중치를 매기려면 표본마다 모델의 밀도 값이 있어야 하는데, 흐름 매칭으로 학습한 연속 정규화 흐름(continuous normalizing flow, CNF)은 이 값 하나를 얻는 데 함수 평가가 200번 넘게 든다.
  • FALCON은 몇 걸음에 크게 건너뛰는 흐름 사상(flow map)을 학습하면서, 앞으로 갔다가 거꾸로 돌아오면 제자리여야 한다는 가역성 벌점을 더한다. 걸음마다 역함수가 있으면 변수 변환 공식으로 밀도를 곧바로 잴 수 있다.
  • 알라닌 펩타이드 네 종에서 4~16걸음짜리 FALCON이 기존 최고 수준의 이산 흐름과 CNF를 대부분의 지표에서 앞섰고, 같은 성능의 CNF보다 추론이 백 배쯤 빨랐다. 다만 가역성은 벌점으로 유도할 뿐 보장되지 않는다.

선정 이유

ICLR 2026 구두 발표(oral)로 뽑혔다. 네 리뷰어의 처음 점수는 10, 8, 6, 4점으로 갈렸고, 가장 낮은 점수는 같은 제1저자의 이전 연구와 얼마나 다른지를 문제 삼았다.

블로그의 연구 여지 지도에서 이 논문은 두 주제가 만나는 자리에 있다. LLM 중심 주제를 뺀 109개 주제 중 1위인 ’MCMC와 신경 샘플러’와 3위인 ’플로우 매칭과 정규화 플로우’다. 둘 다 10월 테마 ’샘플링과 생성 모델의 수학’에 속한다.

  1. 전후로 아는 것이 달라졌나. 조금 달라졌다. 몇 걸음 생성 모델은 빠르지만 밀도를 주지 못해서 중요도 샘플링에는 쓸 수 없다는 것이 그동안의 생각이었다. 이 논문은 역함수만 있으면 된다는 점을 짚고, 벌점 하나로 그 조건을 실험에서 충분히 맞출 수 있음을 보였다.
  2. 새 질문을 여는가. 연다. 가역성을 얼마나 어겨도 가중치가 버티는지, 벌점 대신 구조로 가역성을 보장할 수 있는지, 더 큰 분자에서도 자코비안 비용이 감당되는지가 곧바로 남는다.
  3. 일반화될 근거가 있나. 아직 약하다. 실험은 알라닌 펩타이드 네 종이 전부이고, 모델도 한 크기(매개변수 320만 개)다. 다만 가역성 벌점 자체는 분자에 묶인 장치가 아니다.
  4. 증거가 주장만큼 강한가. 중간이다. 여러 지표와 시드 3개로 비교했지만, 핵심 보장(명제 2)은 벌점이 정확히 0일 때만 성립한다. 실제로 얼마나 가역적인지는 간접적으로만 확인했다.

왜 중요한가

분자가 열평형에서 어떤 모양을 얼마나 자주 띠는지는 볼츠만 분포 \(p(x)\propto e^{-\mathcal E(x)}\)가 정한다. 문제는 에너지 지형이 고차원이고 울퉁불퉁하다는 점이다. 분자 동역학(molecular dynamics)이나 MCMC는 한 골짜기에 오래 갇혀서, 다른 골짜기로 넘어가기까지 감당할 수 없을 만큼 긴 시간이 든다(1장).

볼츠만 생성기는 이 비용을 학습으로 미리 치른다(Noé 외, 2019). 치우친 데이터로 생성 모델 \(p_\theta\)를 학습한 뒤, 모델이 뽑은 표본 \(x^i\)마다 가중치 \(w(x^i)=e^{-\mathcal E(x^i)}/p_\theta(x^i)\)를 매겨 평균을 낸다(2장, 식 2). 이것이 자기 정규화 중요도 샘플링(self-normalized importance sampling, SNIS)이다. 모델이 목표와 조금 달라도 가중치가 그 차이를 메우고, 표본이 많아지면 추정값은 참값으로 모인다. 대신 전제가 있다. \(p_\theta(x)\)가 모델이 실제로 표본을 뽑는 분포의 밀도와 정확히 같아야 한다.

이산 정규화 흐름은 밀도를 정확히 주지만 역함수가 있는 구조만 쓸 수 있고, 최대 가능도 학습이 불안정하다. 흐름 매칭으로 학습한 CNF는 구조가 자유롭고 학습도 안정적이지만 밀도가 비싸다. 밀도를 얻으려면 속도장의 발산(divergence), 곧 자코비안의 대각합을 시간에 걸쳐 적분해야 한다(식 3). 대각합을 정확히 구하려면 걸음마다 차원 수 \(d\)만큼 함수를 평가해야 하고, 허친슨(Hutchinson) 추정기는 가중치를 흔들며, 고정 보폭 적분기는 우도를 부풀린다. 그래서 볼츠만 생성기는 적응형 Dopri5 적분기에 정확한 대각합을 쓰는 것이 관례다(부록 D.2.1). 이렇게 하면 표본 하나에 200~265번의 함수 평가가 든다(표 5).

한편 일관성 모델(consistency model)이나 평균 흐름(MeanFlow) 같은 몇 걸음 생성 모델은 한두 걸음에 좋은 표본을 뽑지만 밀도는 주지 않는다. 볼츠만 생성기에는 빠른 표본과 정확한 밀도가 둘 다 필요하다.

목표e−E(x)모델pθ(x)w = 1.5w = 0.5가중치 w(x) = e−E(x) / pθ(x)모델 밀도를 정확히 알아야 가중치가 맞는다

(가) 볼츠만 생성기

연속 정규화 흐름(CNF)적응형 적분 200~265번 평가 (표 5)FALCON도약마다 log|det J| 한 번4~16번 (표 5)잡음분자 구조

(나) 확률을 재는 비용

시각 s시각 t위아래아래위점선: 참 흐름(순서 유지) 실선: 학습된 도약Xu(x, s, t) = x + (t − s) u(x, s, t)

(다) 도약이 엇갈리면

stxsx̂sx̂t앞으로거꾸로어긋남벌점 λr ‖xs − x̂s‖20이 되면 도약마다 역함수가 있다 (명제 2)

(라) 가역성 벌점

FALCON의 문제와 해법을 네 칸에 나눠 본 그림. (가) 볼츠만 생성기는 모델이 뽑은 표본마다 가중치 w = e−E(x)/pθ(x)를 매겨 목표 분포로 바로잡는다. 모델이 두 우물에 절반씩 표본을 두면(점선), 깊은 왼쪽 우물의 표본은 가중치가 1.5, 오른쪽은 0.5가 되어 참 비율 0.75 대 0.25를 되찾는다(점의 넓이가 가중치). E(x) = 3(x² − 1)² + 0.6x로 계산했다. (나) 연속 정규화 흐름은 모델 밀도를 얻으려고 속도장의 발산을 수백 걸음에 걸쳐 적분하고, FALCON은 몇 번의 큰 도약마다 자코비안 행렬식의 로그를 더한다. 평가 횟수는 논문 표 5의 NFE다. (다) 참 흐름의 경로(점선)는 서로 엇갈리지 않아 역함수가 늘 있지만, 학습이 덜 된 흐름 사상의 도약(실선)은 엇갈려 위아래가 뒤바뀔 수 있다. 그러면 한 점에 두 출발점이 겹쳐 변수 변환 공식이 틀린 밀도를 낸다. (라) FALCON은 앞으로 한 번, 거꾸로 한 번 도약해 제자리로 돌아오는지 보고 어긋난 만큼 벌점을 준다(식 8). (다)와 (라)는 1차원으로 단순화한 개념도다.

핵심 아이디어

직관: 참 흐름을 흉내 낼 필요는 없고, 되돌아올 수만 있으면 된다

흐름 매칭 모델은 잡음 \(x_0\)에서 데이터 \(x_1\)로 가는 속도장 \(v(x_s,s)\)를 배운다. 흐름 사상은 여기서 한발 더 나가, 시각 \(s\)에서 \(t\)까지의 평균 속도를 배운다(식 4).

\[ u(x_s,s,t)=\frac{1}{t-s}\int_s^t v(x_\tau,\tau)\,d\tau,\qquad X_u(x_s,s,t)=x_s+(t-s)\,u(x_s,s,t) \]

평균 속도를 알면 적분을 따라가지 않고 한 번에 \(t\)로 건너뛴다. 평균 속도 손실을 완전히 최소화하면 \(X_u\)는 참 흐름과 같아지고, 참 흐름은 늘 역함수가 있으니 변수 변환 공식으로 밀도도 잴 수 있다(명제 1). 문제는 학습이 끝나지 않은 실제 모델이다. 학습된 도약은 참 흐름과 조금씩 어긋나고, 가까운 두 점의 도약이 엇갈리면 사상이 접힌다. 접힌 사상에서는 한 점에 여러 출발점이 겹치는데, 공식은 그중 한 출발점의 자코비안만 보니 밀도가 틀린다.

저자들이 짚은 요점은 이렇다. 볼츠만 생성기에 필요한 것은 참 흐름과 똑같은 사상이 아니라, 역함수가 있는 사상이다. 역함수만 있으면 모델이 표본을 뽑는 분포의 밀도는 정확히 잴 수 있고, 목표 분포와의 차이는 중요도 가중치가 메운다. 정확도와 타당성을 떼어 놓은 셈이다(3장).

방법: 갔다가 돌아오는 벌점

FALCON은 이 조건을 손실 하나로 쓴다. 시각 \(s\)에서 \(t\)로 도약한 뒤 다시 \(s\)로 도약했을 때 제자리로 돌아오는지를 본다(식 8).

\[ \mathcal L_{\text{inv}}(\theta)=\mathbb E_{s,t,x_s}\big\|\,x_s-X_u\big(X_u(x_s,s,t),\,t,\,s\big)\big\|^2 \]

전체 손실은 흐름 매칭 손실, 평균 속도 손실, 가역성 손실의 합이다(식 9). 평균 속도 손실로는 MeanFlow와 같은 꼴을 쓴다(식 10). 평균 속도를 시각 \(s\)로 미분한 값이 들어가는데, 이 값은 전진 모드 자동 미분의 야코비안 벡터 곱(JVP) 한 번으로 얻는다(알고리즘 1). 흐름 매칭 손실은 따로 두지 않고, 학습 쌍의 일부를 \(s=t\)로 뽑아 평균 속도 손실에 녹인다. 이때 \(u(x,s,s)\)가 순간 속도가 된다.

거꾸로 가는 도약도 같은 신경망이 맡는다. \(t<s\)인 입력도 받아야 하므로, \(s=t\) 근처의 불연속을 피하려고 \(u_\theta(x_s,s,t)=\mathrm{sign}(t-s)\,h_\theta(x_s,s,t)\) 꼴로 둔다(3장 끝). 신경망은 표준 확산 트랜스포머(DiT)에 시간 입력 하나를 더한 것이고, 네 펩타이드 모두 매개변수 320만 개짜리 같은 크기를 쓴다(표 6). 가역성 벌점의 세기 \(\lambda_r\)는 따로 적지 않으면 10이다(4.4절).

수식: 무엇을 보장하나

표본을 뽑을 때는 잡음 \(x_0\sim p_0\)에서 출발해 시간 격자 \(0=t_0<\dots<t_N=1\)을 따라 \(N\)번 도약하고, 도약마다 자코비안 행렬식의 로그를 뺀다(부록 D.2.1, 알고리즘 2).

\[ x_i=X_u(x_{i-1},t_{i-1},t_i),\qquad \log p_i=\log p_{i-1}-\log\big|\det \mathbf J_{X_u}(x_{i-1})\big| \]

명제 2는 가역성 손실의 최소화점, 곧 손실이 0인 매끄러운 \(u\)에서는 모든 \((s,t)\)에 대해 \(X_u(\cdot,s,t)\)가 어디서나 역함수를 갖고 위 공식이 거의 모든 점에서 맞는다고 말한다(부록 A).

비용은 이렇다. CNF의 우도는 적응형 적분기가 고른 걸음 수 \(T_l\)에 차원 \(d\)를 곱한 만큼의 함수 평가가 들고, FALCON은 도약 수 \(N\)에 \(d\)를 곱한 만큼이 든다. 실험에서는 \(T_l\)이 200 안팎, \(N\)이 8 안팎이다(부록 D.2.1). 행렬식의 \(O(d^3)\) 계산은 함수 평가 비용에 묻힌다. 빨라진 몫은 걸음 수에서 나온다.

1차원 이중 우물에서 FALCON의 손실을 벌점 없이, 또 벌점을 넣어 학습해 보면 차이가 보인다. 벌점이 없으면 한 걸음에 건너뛰는 사상이 학습 도중 군데군데 접히고, 그때마다 변수 변환으로 잰 밀도가 틀려 몇몇 표본이 가중치를 독차지한다. 가중치로 바로잡은 답도 참값에서 벗어난다. 벌점을 주면 같은 시점에도 사상이 접히지 않는다. 다만 이 쉬운 예에서는 두 걸음 이상으로 나눠 뽑으면 벌점이 없어도 접히지 않았다. 도약이 클수록 가역성이 깨지기 쉽다는 뜻이다.

−2−1012−3−2−10123잡음 x₀표본 x₁λ = 10: 늘 오르막λ = 0: 접히는 구간

(가) 학습 1,000단계의 한 걸음 사상

0.00010.0010.010.112505001,0002,0004,000학습 단계ESS (한 걸음)λ = 10λ = 0

(나) 학습 중 유효 표본 비율

FALCON의 손실을 1차원 이중 우물 E(x) = 3(x² − 1)² + 0.6x에서 가역성 벌점 없이(λ = 0) 또는 논문 기본값(λ = 10)으로 학습한 결과. 학습 데이터는 두 우물에 절반씩 둔 표본 10만 개로, 깊은 왼쪽 우물의 참 비율 0.748보다 치우쳐 있다. 평균 속도 손실(식 10)에 넷 중 하나는 s = t로 두어 흐름 매칭 손실을 섞었고, 신경망은 폭 128인 3층 MLP, 학습은 4,000단계, 시드 3개다. (가) 시드 0 모델의 한 걸음 사상 x₀ → x₁. 벌점이 없으면 색칠한 구간에서 기울기가 음수가 되어 사상이 접힌다. (나) 학습 도중 250, 500, 1,000, 2,000, 4,000단계에서 한 걸음으로 표본 10만 개를 뽑고 변수 변환 공식으로 잰 밀도로 매긴 가중치의 유효 표본 비율(ESS, 로그 눈금). 선 하나가 시드 하나다. 벌점이 없는 모델은 15번 중 10번 ESS가 0.01 아래로 떨어졌고, 그때 왼쪽 우물 비율 추정값은 0.76~0.85로 참값을 벗어났다. 벌점을 준 모델은 모든 시점에서 ESS 0.35~0.68, 추정값 0.746~0.747였다. 두 걸음 이상으로 뽑을 때는 두 모델 모두 접히지 않았다.

결과 해설

더 큰 펩타이드에서 앞선다. 표 3은 알라닌 셋(AL3), 넷(AL4), 여섯(AL6)으로 된 펩타이드에서 에너지 분포의 2-바서슈타인 거리(\(\mathcal E\)-\(\mathcal W_2\)), 이면각 분포의 토러스 2-바서슈타인 거리(\(\mathbb T\)-\(\mathcal W_2\)), 유효 표본 비율(ESS)을 잰다. 에너지 거리는 결합 길이처럼 세밀한 구조에, 이면각 거리는 준안정 상태를 빠짐없이 덮었는지에 민감하다(4.1절). FALCON의 에너지 거리는 0.544, 0.686, 0.892로 세 계 모두에서 가장 낮다. 이산 흐름 SBG에 중요도 샘플링을 붙인 것은 0.758, 1.068, 1.021이다. CNF인 ECNF++는 2.206, 5.638, 10.668로 계가 커질수록 크게 무너진다. ESS도 FALCON이 0.077, 0.055, 0.060으로 SBG(0.052, 0.046, 0.034)와 ECNF++(0.003, 0.016, 0.006)보다 높다. 덧셈 꼴 손실을 쓴 변형 FALCON-A는 ESS가 더 높지만 에너지 거리는 뒤진다.

가장 작은 분자에서는 CNF가 이긴다. 알라닌 두 개짜리(ALDP)에서는 ECNF++의 ESS가 0.275로 FALCON(0.067)의 네 배가 넘는다(표 2). FALCON은 에너지 거리(0.225)에서만 가장 좋다. 적분기를 똑같이 Dopri5로 맞추면 FALCON의 ESS도 0.264까지 오르는데, 이때는 함수 평가가 4번에서 257번으로 는다(표 5).

같은 성능에 드는 시간. ALDP에서 이면각 거리를 같은 수준으로 맞추는 데 CNF는 FALCON보다 두 자릿수 긴 추론 시간이 든다(그림 2). 몇 걸음 FALCON은 4~16번의 함수 평가로 표 2와 표 3의 성적을 냈고, 같은 모델을 Dopri5로 돌리면 200~265번이 든다(표 5). 학습과 추론을 합친 시간은 AL6에서 FALCON은 25.76으로 SBG(57.50)의 절반이 안 되고 ECNF++(137.4)의 5분의 1이 안 된다(표 4). ALDP에서 SBG로 표본을 500만 개까지 뽑아도, 250배 적은 표본을 쓴 4걸음 FALCON보다 에너지 거리가 크다(그림 4).

벌점의 세기는 양날이다. 그림 6은 ALDP에서 \(\lambda_r\)를 1에서 \(10^4\)까지 바꿔 본다. 벌점이 너무 세면 표본 질이 떨어져, 4걸음 이상에서는 이면각 거리가 \(\lambda_r=10\) 근처에서 가장 낮다. ESS가 가장 높은 벌점은 걸음 수마다 다르다. 2걸음은 1, 4걸음은 10, 8걸음과 16걸음은 100 근처다.

의심해볼 점

  • 가역성은 유도할 뿐 보장하지 않는다. 명제 2는 가역성 손실이 정확히 0일 때의 이야기다. 실제로 학습한 모델은 앞으로 갔다 돌아올 때 \(10^{-2}\) 수준의 오차를 남긴다(부록 F.2). 저자들도 한계 절에서 계산한 우도가 경험적으로 충분히 좋을 뿐, 이론적으로 맞는지 효율적으로 보장할 수는 없다고 적었다. 사상이 접히면 가중치는 흔들리는 데서 그치지 않고 한쪽으로 치우친다. 표본을 늘려도 사라지지 않는 오차다.
  • 가역성 확인 실험이 보여 주는 범위. 저자들은 학습이 끝난 FALCON을 얼려 두고, 거꾸로 가는 보조 모델을 따로 학습해 복원 오차가 \(10^{-4}\)까지 내려감을 보였다(부록 F.2). 전형적인 표본 근처에서 역함수가 있다는 증거로는 좋지만, 확률이 낮은 영역까지 사상이 접히지 않는지, 행렬식으로 잰 밀도가 참 밀도와 얼마나 맞는지를 직접 잰 것은 아니다.
  • 벌점을 뺀 비교가 없다. 그림 6은 \(\lambda_r=1\)부터 시작한다. 벌점이 아예 없을 때 어떻게 되는지가 이 방법의 핵심 주장인데, 그 비교는 표에 없다. 게다가 2걸음 모델은 \(\lambda_r\)를 1에서 100으로 올릴수록 ESS가 오히려 떨어진다. 저자 답변에서는 큰 계에 더 센 벌점을 썼다고 밝혔지만, 본문에는 기본값 10만 적혀 있다.
  • ESS의 절댓값. AL3에서 AL6까지 몇 걸음 FALCON의 ESS는 5.5~7.7%다(표 3). 표본 1만 개를 뽑으면 실제로 쓸모 있는 표본은 수백 개라는 뜻이다. 기준선보다 낫다는 것과 충분하다는 것은 다른 이야기다.
  • 구조가 다른 모델끼리의 비교. FALCON은 DiT, ECNF++는 등변 신경망, SBG는 TarFlow 구조를 쓴다. 차이가 손실에서 오는지 구조에서 오는지 가르려면 같은 구조로 비교해야 한다는 지적이 있었고, 저자들은 등변 구조를 쓰면 다시 비용 문제가 생긴다며 받아들이지 않았다.
  • 식 10의 부호. 점 \(x_s\)가 적분 구간의 아래 끝에 있으므로 \((t-s)\,u=\int_s^t v\,d\tau\)를 \(s\)로 미분하면 \(u=v+(t-s)\frac{d}{ds}u\)가 나온다. 식 10과 알고리즘 1은 빼기 부호를 쓰는데, 이는 점을 위 끝에 두는 MeanFlow의 꼴이다. 블로그의 해석으로는 식을 옮기며 생긴 표기 오류이고, 적힌 부호대로 구현하면 학습이 안정되지 않는다.
  • 규모. 가장 큰 계는 알라닌 여섯 개짜리 펩타이드다. 도약마다 자코비안 전체를 계산해야 하므로 차원이 커질수록 걸음당 비용이 커진다. 여러 분자에 한 모델을 쓰는 전이 가능한(transferable) 설정도 다루지 않았다.

리뷰어들이 짚은 점

메타 리뷰는 이전 연구와의 차이에 대한 우려는 해소됐다고 보면서도, 가역성이 근사로만 성립하고 그 근사가 결과에 미치는 영향을 직접 분석하지 않은 점을 남은 문제로 꼽았다.

  • 이전 연구와의 차이 (4점). 같은 제1저자의 RegFlow(Rehman 외, 2025)와 목표와 실험이 매우 비슷하다는 지적이었다. 저자들은 RegFlow는 가역 구조와 미리 정한 가역 결합(coupling)이 필요하지만 FALCON은 그렇지 않다고 답하고, RegFlow를 비교표에 넣었다.
  • ALDP의 낮은 ESS와 오차 누적 (6점). 저자들은 적분기 차이 때문이라고 답했다. 리뷰어는 걸음 수가 중간쯤일 때 가역성 오차가 쌓이지 않는지 여전히 궁금하다고 남겼다.
  • 모델 크기 (8점). 비교 모델과 크기를 맞춰 보라는 제안에 저자들은 약 6천만 개였던 매개변수를 320만 개로 줄였고, 성능은 유지되거나 나아졌다(표 3).
  • 특이한 자코비안 (10점). 행렬식이 0에 가까운 곳에서 우도가 불안정해지지 않느냐는 질문에, 저자들은 가역성 벌점이 그런 영역을 억누른다고 답하고 매끄러움 가정을 ReLU 신경망까지 넓혔다.

계보

  • 볼츠만 생성기. Noé 외(Science, 2019)가 가역 생성 모델과 중요도 샘플링을 묶는 틀을 처음 내놓았다. 이후 등변 흐름 매칭 CNF(Klein 외, NeurIPS 2023), 전이 가능한 볼츠만 생성기(Klein, Noé, NeurIPS 2024), TarFlow 구조의 이산 흐름에 순차 몬테카를로를 붙인 SBG(Tan 외, 2025)로 이어졌다.
  • 가역성을 벌점으로. 자유 형태 흐름(free-form flows, Draxler 외, AISTATS 2024)은 보조 역함수 신경망을 함께 학습해 아무 구조나 정규화 흐름처럼 쓰게 했다. RegFlow(Rehman 외, arXiv 2506.01158)는 CNF나 최적 수송이 정한 가역 결합을 이산 흐름에 회귀로 옮겼다. FALCON은 두 발상을 몇 걸음 흐름 사상 위로 옮긴 자리에 있다.
  • 몇 걸음 생성. 일관성 모델(Song 외, 2023), 숏컷 모델(Frans 외, 2025), 흐름 사상의 자기 증류(Boffi 외, NeurIPS 2025), MeanFlow(Geng 외, NeurIPS 2025)가 평균 속도를 배우는 틀을 만들었다. FALCON의 평균 속도 손실은 MeanFlow와 같은 꼴이다.
  • 동시 연구와 후속 연구. F2D2(Ai 외, arXiv 2512.02636)는 표본 경로와 누적 발산을 함께 증류해 우도 계산 횟수를 두 자릿수 줄였다. 2026년 9월 기준 FALCON을 인용한 논문은 13편이다(Semantic Scholar). SCALLOP(OuYang 외, arXiv 2606.29110)은 F2D2 위에서 허친슨 추정 없이 우도를 증류해 볼츠만 생성기에 썼고, FALCON 저자 셋이 참여한 후속 연구는 흐름을 떠나 자기회귀 모델로 볼츠만 생성기를 만들었다(arXiv 2606.27361).
  • 같은 테마의 이전 글. 기울기만으로 거부 샘플링을 하는 논문도 보정 단계에 밀도가 필요하다는 같은 벽을 다룬다. 그 논문은 밀도 없이 기울기만으로 보정하는 길을 찾았고, FALCON은 밀도를 싸게 얻는 길을 찾았다.

열린 질문

  1. 가역성은 얼마나 어겨도 되나. 되돌아오는 오차나 사상이 접힌 영역의 크기와 중요도 가중치의 치우침 사이에 어떤 관계가 있을까. 표본마다 그 밀도를 믿어도 되는지 알려 주는 진단을 만들 수 있을까.
  2. 벌점 대신 구조로. 몇 걸음 도약의 표현력을 지키면서 가역성을 설계 단계에서 보장할 수 있을까. 그렇게 하면 벌점 세기를 고르는 부담과 표본 질의 손해가 함께 사라질까.
  3. 큰 계로 가는 길. 차원이 커질 때 도약마다 드는 자코비안 비용을 어떻게 줄일 수 있을까. 여러 분자에 한 모델을 쓰는 설정에서도 몇 걸음 우도가 충분히 정확할까.

이해 확인

1. MeanFlow 같은 몇 걸음 흐름 모델을 그대로 볼츠만 생성기로 쓰기 어려운 까닭은?

  1. 한 걸음에 뽑은 표본의 질이 너무 나빠서
  2. 에너지 함수의 기울기가 있어야 학습할 수 있어서
  3. 학습이 덜 된 도약은 역함수가 없을 수 있어, 변수 변환 공식으로 잰 밀도가 틀릴 수 있어서
  4. 표본을 뽑는 데 적응형 적분기가 필요해서

평균 속도 손실을 완전히 최소화하면 사상이 참 흐름과 같아져 역함수가 있다(명제 1). 실제 모델은 그렇지 않아서 사상이 접힐 수 있고, 그러면 행렬식으로 잰 밀도가 모델이 실제로 뽑는 분포와 달라진다(3장). 에너지는 미분할 수 없어도 되고(2장), 몇 걸음 모델은 적분기 없이 도약한다.

2. FALCON이 학습된 사상이 참 흐름과 똑같을 필요는 없고 역함수만 있으면 된다고 보는 까닭은?

  1. 참 흐름은 계산할 방법이 없어서
  2. 역함수가 있으면 모델이 뽑는 분포의 밀도를 정확히 잴 수 있고, 목표와의 차이는 중요도 가중치가 메우기 때문에
  3. 역함수가 있으면 자코비안을 계산하지 않아도 되기 때문에
  4. 참 흐름을 따라 하면 표본의 다양성이 줄어서

중요도 샘플링은 모델 분포가 목표와 달라도 되지만, 가중치에 쓰는 밀도는 모델이 실제로 표본을 뽑는 분포의 밀도여야 한다. 가역 사상이면 변수 변환 공식이 그 밀도를 정확히 준다(명제 2). 자코비안 행렬식은 여전히 도약마다 계산한다(알고리즘 2).

3. 같은 성능의 CNF보다 우도 계산이 두 자릿수 빨라진 주된 이유는?

  1. 우도에 드는 함수 평가가 걸음 수에 비례하는데, 걸음 수가 200 안팎에서 4~16으로 줄었기 때문에
  2. 자코비안 대각합 대신 허친슨 추정기를 썼기 때문에
  3. 자코비안이 삼각 행렬이 되도록 구조를 제한했기 때문에
  4. 가역성 벌점이 행렬식 계산을 없애 주기 때문에

CNF의 우도 비용은 적응형 적분기의 걸음 수 T_l에 차원 d를 곱한 만큼이고, FALCON은 도약 수 N에 d를 곱한 만큼이다(부록 D.2.1). 두 방법 모두 자코비안을 정확히 계산하고, FALCON은 구조를 제한하지 않는 DiT를 쓴다. 빨라진 몫은 걸음 수에서 나온다(표 5).

논문 정보

  • 제목: FALCON: Few-step Accurate Likelihoods for Continuous Flows
  • 저자: Danyal Rehman, Tara Akhound-Sadegh, Artem Gazizov, Yoshua Bengio, Alexander Tong (Mila, Université de Montréal, AITHYRA, McGill University, Harvard University)
  • 학회: ICLR 2026 Oral
  • 링크: arXiv 2512.09914, OpenReview