서열로는 보이지 않던 GPCR의 먼 친척을 구조로 찾았다
Nature ’TM184C is a GPCR-like regulator of intercellular exchange and autophagy’를 ML 연구자의 눈으로 읽기
TM184C is a GPCR-like regulator of intercellular exchange and autophagyNature 657(8132), 833-843
한 줄 요약과 선정 근거
AlphaFold가 예측한 단백질 구조 2억 1천만여 개를 GPCR의 원형인 로돕신과 하나하나 맞대어 보니, 서열로는 GPCR과 전혀 닮지 않았는데 모양은 GPCR인 사람 단백질들이 나왔다. 연구진은 그 가운데 TM184C를 골라 실험으로 파고들었고, 이 단백질이 GPCR처럼 인산화되고 아레스틴과 붙지만 세포 표면이 아니라 세포 안 소포에 살며, 세포 사이에 다리를 놓아 소포와 소기관을 이웃 세포로 넘긴다는 것을 보였다.
Nature는 같은 날 GPCR 연구자 M. Madan Babu의 해설 기사(News & Views)를 함께 실었다. 골랐던 이유는 두 가지다. 첫째, 예측 구조 데이터베이스를 검색 대상으로 삼아 서열 비교로는 닿지 않던 단백질의 기능을 찾아냈다는 점에서, 구조 예측이 생물학에 무엇을 새로 해 줄 수 있는지 보여 주는 구체적인 사례다. 둘째, 심사 기록이 공개돼 있어 검색 방법의 비용과 민감도를 두고 심사위원과 저자가 주고받은 논쟁을 그대로 읽을 수 있다. 원고는 2025년 3월 10일에 접수돼 2026년 8월 5일에 채택됐고, 그사이 세 차례 심사를 거쳤다.
배경지식 세 가지
- GPCR과 아레스틴: G 단백질 연결 수용체(G-protein-coupled receptor, GPCR)는 세포막을 일곱 번 지나는 막단백질로, 사람에게 800개가 넘고 시판 약물의 주요 표적이다. 세포 밖에서 리간드가 붙으면 모양이 바뀌어 세포 안의 G 단백질을 움직인다. 그 뒤 GPCR 인산화효소(GRK)가 수용체의 세포질 쪽 꼬리에 인산기를 붙이고, 그 자리에 베타 아레스틴(β-arrestin)이 달라붙어 신호를 끄고 수용체를 세포 안으로 끌어들인다. G 단백질 결합, GRK 인산화, 아레스틴 결합이 GPCR을 알아보는 세 가지 표지다.
- 서열의 황혼 지대: 단백질의 기능은 대부분 이미 아는 단백질과 서열이 얼마나 닮았는지로 추정한다. 그런데 진화 시간이 길어지면 서열 일치도가 우연 수준으로 떨어져, 친척인지 남인지 서열만으로는 가리기 어려운 구간이 생긴다. 이를 황혼 지대(twilight zone)라고 부른다. 반면 단백질의 3차원 모양은 서열보다 훨씬 오래 보존된다. 구조 기반 탐색은 모양이 같으면 먼 친척일 수 있다는 생각에서 시작한다.
- 어두운 단백질과 TM-score: 사람 단백질 20,412개 가운데 5,516개(27%)는 기능 자료가 거의 없어 Tdark로 분류된다(그림 1b). 저자들은 여기서 한 걸음 더 나가, 서열로는 기능 아는 단백질과 이어지지 않지만 구조로는 이어지는 단백질을 슈퍼다크(superdark)라고 부른다. 구조 비교에는 TM-align이 계산하는 TM-score를 쓴다. 두 구조를 겹쳐 얼마나 잘 맞는지를 0에서 1 사이로 나타낸 값이고, 0.5를 넘으면 대체로 같은 접힘(fold)으로 본다.
무엇을 발견했나
구조로 걸러 낸 후보. 연구진은 AlphaFold DB(v4)의 예측 구조 214,528,851개 전부를 소의 로돕신 구조(PDB 1F88)와 TM-align으로 비교했다. 길이 200잔기 이상에 TM-score 0.5 이상인 구조가 1,543,898개였고, 폐기된 UniProt 항목을 빼면 1,461,479개가 남았다(본문, 방법 절). 연구진은 이 가운데 GPCR로 알려진 것이 35%(506,129개), 그렇지 않은 7TM 단백질이 65%(955,350개)라고 분류했다(그림 1c). 사람 단백질에서는 서열로는 GPCR과 이어지지 않는 후보 여덟 개가 나왔다. 이미 GPCR로 제안된 두 개를 빼면 TM184 가족(TM184A, TM184B, TM184C, SLC51A)과 PRRT 가족(PRRT3, PRRT4)이 남는다.
TM184C를 고른 기준은 조직 발현이다. 여섯 후보 가운데 가장 많은 조직에서, 가장 높게 발현됐다(확장 데이터 그림 1a). PSI-BLAST로 거슬러 올라가 보니 TM184C는 고세균과 세균의 단백질까지 서열로 직접 이어졌다(확장 데이터 그림 1f, 1g). 서열만으로 고세균까지 추적되는 GPCR은 저자들이 아는 한 없다.
GPCR의 세 표지 가운데 둘. 리간드를 모르기 때문에 연구진은 리간드 없이 켜져 있는 활성을 쟀다. 세 가지 측정법(4A, mini G, TRUPATH)에서 TM184C의 G 단백질 결합은 배경 수준을 재현성 있게 넘지 못했다(그림 2a~d). 반면 TM184C는 TM184 가족 가운데 유일하게 아레스틴을 불러왔고, 그 세기는 대표적인 GPCR인 ADRB2가 리간드 없이 보이는 결합과 비슷했다(그림 2e). GRK2도 ADRB2만큼 붙었다(그림 2i). 질량분석에서 찾은 인산화 자리 세 곳(S422, S432, S435)은 모두 미리 예측한 아레스틴 코드 안에 있었다(그림 2j). 꼬리 끝 82개 잔기를 잘라 낸 변이체(Δ82)나 아레스틴 코드의 인산화 자리 11곳을 알라닌으로 바꾼 변이체(ACM)는 아레스틴을 덜 끌어왔다(그림 2f, 2g, 2k). 저자들은 TM184C가 G 단백질 대신 아레스틴으로 신호를 보내는 비정형 케모카인 수용체와 닮았다고 보고, 아레스틴 연결 수용체라는 새 무리일 수 있다고 쓴다.
세포 안 소포와 세포 사이 다리. TM184C는 세포 표면에 거의 없고, 지름 500nm에서 5μm의 소포에 있었다. 후기 엔도솜, 리소좀, 자가포식소체 표지와 겹쳤고(확장 데이터 그림 1d, 6), 소포는 미세소관을 따라 양방향으로 빠르게 움직였다(그림 3c). TM184C를 많이 만든 세포는 길고 가는 돌기를 내밀었고, 돌기끼리 이어져 터널링 나노튜브(tunnelling nanotube)를 닮은 세포 사이 다리가 생겼다.
(가) 교과서의 GPCR
(나) 슈퍼다크 단백질 TM184C
연구진은 다리와 돌기의 길이와 이어진 세포 수를 가중해 합한 점수(bpp 점수)를 만들어 정량했다. TM184C를 과발현한 세포의 점수는 기준 세포의 약 세 배였고, 내재성 TM184C를 없앤 뒤에도 기준 세포에서 같은 유전자를 없앤 경우보다 약 15배 높게 유지됐다(그림 4). 반면 ACM이나 Δ82만 남은 세포는 내재성 TM184C를 없애자 다리와 돌기를 거의 잃었다. 빨강과 초록 형광을 붙인 세포를 섞어 키우자, TM184C 세포끼리는 소포가 양쪽으로 오갔고, TM184C 세포에서 TM184A, TM184B, ACM 세포 쪽으로는 한 방향으로만 넘어갔다(그림 5). 다른 세포 네 종류에서도 소포 교환이 보였다(확장 데이터 그림 10).
자가포식을 누르는 오래된 기능. TM184C를 줄인 세포에서는 자가포식소체 막에 붙는 LC3B-II가 쌓였다. 리소좀 산성화를 막는 콘카나마이신 A를 넣으면 더 늘어난 것으로 보아, 분해가 막힌 것이 아니라 자가포식소체가 더 많이 만들어진 쪽이다(확장 데이터 그림 2a, 2b). 효모에서 TM184C에 해당하는 유전자 Hfl1을 없애면 액포 모양이 망가지는데, 사람 TM184C를 넣으면 회복됐고 TM184A와 TM184B는 그러지 못했다(확장 데이터 그림 2c, 2e). 연구진은 이 기능이 효모와 사람이 갈라지기 전부터 있었다고 본다.
어떻게 했나
- 구조 전수 비교: 압축 상태로 24TiB, 풀면 60TiB인 AlphaFold DB를 내려받아 1,000개의 작업으로 나눠 계산 클러스터에서 TM-align을 돌렸다(방법 절). 심사 기록의 저자 답변에 따르면 작업 하나가 코어 하나에서 약 34시간 걸려, 모두 합하면 약 34,000 CPU 시간이다.
- 모양 검증: TM-score 하나로는 접힘이 제대로 맞는지 알기 어려워, 로돕신의 7TM 부분을 표면으로 본뜨고 후보 구조가 그 표면을 얼마나 빈틈없이 덮는지 따로 쟀다. 끝이 잘렸거나 중간이 비었는지에 따라 1, 2, 3등급을 매겼고, 비율은 47%, 36%, 17%였다(본문, 확장 데이터 그림 3).
- 서열로 되짚기: 모양이 같은 7TM 단백질들이 서열 신호를 조금이라도 공유하는지 보려고, 7TM 부분만 잘라 낸 서열을 MMseqs2로 39,808개 대표 서열로 줄이고 전체 대 전체 BLASTp를 돌려 유사성 네트워크를 만들었다. 연결 문턱은 서열 일치도 30% 이상, 비트 점수 30 이상이었다. 고세균의 히스티딘 인산화효소에서 진핵생물의 GPCR까지 여섯 단계 이내로 이어졌다(그림 1e~1g).
- 세포 실험: 생물발광 에너지 전달(BRET)로 결합을 재고, CRISPR로 유전자를 없애고, 가이드 RNA가 알아보지 못하게 코돈을 바꾼 TM184C를 넣어 되살리는 실험을 했다. 영상 정량에는 bpp 점수와, 소포 중심점들을 삼각분할해 서로 다른 색 소포 사이의 짧은 변을 세는 방법을 새로 만들었다(확장 데이터 그림 8, 9). 코드는 MIT 라이선스로 공개됐다.
분야에서의 의미
- 사람 GPCR 가운데 100개 넘게 아직 Tdark다(본문). 이 논문은 목록 바깥에 GPCR을 닮은 단백질이 더 있다는 것을 보였다. 모양만 닮은 단백질이 GPCR 약물과 엉뚱하게 반응할 가능성도 따져 볼 거리다. 한 심사위원도 1차 심사에서 이 점을 물었다.
- 세포 사이 나노튜브는 20여 년 전에 처음 보고됐지만 이를 전담해 조절하는 분자는 드물었다. 저자들은 TM184C를 그런 조절자 후보로 내세운다.
- 방법 면에서는 예측 구조로 후보를 뽑고, 세포 표현형으로 이어 가는 전 과정을 한 논문에 담았다.
ML 연구자를 위한 인사이트
1. 예측 구조 데이터베이스를 검색 색인으로 쓴다 (AI 활용 사례, 직접 적용)
AlphaFold 하면 흔히 단백질 한 개의 구조를 예측하는 일을 떠올린다. 이 논문은 예측 결과 2억 개를 통째로 검색 대상으로 삼았다. 서열 공간에서는 거리가 멀어 서로 보이지 않던 단백질이 구조 공간에서는 가까이 붙는다. 표현을 바꾸면 검색이 닿는 범위가 바뀐다는 이야기이고, 임베딩 검색을 다루는 ML 연구자에게 익숙한 구도다. 저자들 스스로 한계로 적었듯이 예측 구조가 부정확한 영역에서는 후보를 놓칠 수 있다. 그림 1d에서도 구조를 예측 신뢰도(pLDDT)로 칠해 보여 준다.
2. 전수 검색과 빠른 근사 검색, 무엇으로 비교할까 (방법론 교훈, 직접 적용)
심사 기록에서 가장 오래 이어진 논쟁이다. 한 심사위원은 같은 로돕신 구조로 Foldseek을 직접 돌려 82 CPU 시간 만에 저자들이 보고한 적중의 상당수를 다시 찾았다며, 약 34,000 CPU 시간이 든 전수 비교보다 400배쯤 빠르다고 지적했다. 저자들은 네 가지 GPCR 구조로 질의를 바꿔 보니 자신들의 방법은 적중이 약 95% 겹쳤고 슈퍼다크 후보는 모두 겹치는 쪽에 있었던 반면, Foldseek은 E값 1에서 겹침이 약 54%에 그쳤고 E값 0.01에서는 TM184C를 놓쳤다고 답했다(심사 기록, 확장 데이터 그림 4). 다른 심사위원은 발견 하나를 근거로 두 방법의 우열을 말하기는 어렵다고 짚었고, 결국 본문에는 Foldseek 결과가 질의 구조에 따라 달라졌다는 문장만 남았다.
ML 연구자라면 이 논쟁을 검색 평가의 문제로 읽게 된다. 찾고 싶은 것이 드물고 정답 목록이 없을 때, 재현율(recall)은 무엇으로 재야 할까. 슈퍼다크처럼 정의상 알려진 예가 거의 없는 대상에서는 발견 하나가 곧 시험 문제가 된다. 블로그의 해석으로는, 빠른 방법으로 넓게 거르고 전수 비교로 다시 확인하는 2단계 설계를 두고 단계마다 무엇을 얼마나 놓치는지 따로 재는 평가 틀이 먼저 필요해 보인다. 저자들도 마지막 답변에서 빠른 방법은 탐색의 1차 도구로 훌륭하고 전수 검색은 놓치는 것을 줄이는 일이 늘어난 계산 비용보다 중요할 때 쓸 일이라고 정리했다.
3. 문턱은 비교 횟수와 함께 움직인다 (방법론 교훈, 직접 적용)
유사성 네트워크의 연결 문턱을 두고 또 다른 공방이 있었다. 한 심사위원은 비트 점수 30 언저리는 우연히 나올 수 있는 수준이라, 짧은 조각끼리 맞춘 우연한 정렬이 네트워크에 섞였을 수 있다고 지적했다. 저자들은 비트 점수가 데이터베이스 크기와 무관한 값이고, 사람의 알려진 GPCR 관계가 끊기지 않는 가장 낮은 값으로 문턱을 정했으며, 정렬이 짧은 조각이 아니라 7TM 전체에 걸쳐 있다고 답했다.
비트 점수 자체는 데이터베이스 크기와 무관하다. 하지만 같은 문턱을 넘는 우연한 쌍의 개수는 비교하는 쌍의 수에 비례한다. 아래 그래프는 비트 점수의 정의만으로 계산한 기대값이다. 문턱을 맞춘 사람 집합(2,029개)에서는 30비트를 우연히 넘는 쌍이 약 120개이고, 네트워크를 만든 대표 서열 39,808개에서는 약 4만 6천 개다. 서열 일치도 30% 조건이 이 가운데 상당수를 걸러 낼 것이고, 실제 네트워크에서 거짓 연결이 몇 개인지는 이 계산으로 알 수 없다. 다만 작은 집합에서 정한 문턱을 스무 배 큰 집합에 그대로 옮기면 우연한 연결의 기대 개수는 약 400배로 늘어난다는 점은 분명하다. 작은 검증 집합에서 정밀도를 맞춘 분류기를 훨씬 큰 후보 풀에 돌릴 때와 같은 문제다.
4. 공개된 146만 개 7TM 목록 (새 문제와 데이터, 영감 수준)
정렬 점수, 등급, 계통 분류가 붙은 7TM 단백질 146만여 개의 목록이 Zenodo에 공개돼 있고, 해당 구조는 AlphaFold DB에서 바로 받을 수 있다. 구조는 같은데 서열 신호는 거의 없는 단백질 무리는 단백질 언어 모델의 임베딩이 서열 너머의 관계를 얼마나 잡는지 시험하기 좋은 판이다. 다만 이 목록의 라벨은 예측 구조와 기하 규칙에서 나온 것이라 정답이 아니라 후보다. 실험으로 확인된 슈퍼다크는 아직 TM184C와 PRRT 가족 정도뿐이다.
한계와 남은 질문
- 리간드와 구조가 없다. TM184C를 무엇이 켜는지는 모른다. 저자들도 저온전자현미경이나 결정 구조로 활성 상태를 확인해야 한다고 적었다. GPCR을 닮은 모양도 아직은 예측 구조에 기댄 결론이다.
- GPCR이라는 이름은 조심스럽게. G 단백질 결합이 보이지 않았으니 세 표지 가운데 둘만 갖췄다. 한 심사위원은 아레스틴 결합은 GPCR이 아닌 단백질에서도 일어난다고 지적했고, 다른 심사위원은 GPCR 비슷한 단백질보다 아레스틴 연결 수용체라고 부르자고 제안했다. 해설 기사의 제목도 이 단백질이 GPCR처럼 생겼지만 다르게 행동한다고 적는다.
- 과발현과 한 가지 세포주. 다리 형성과 소포 전달의 핵심 증거는 대부분 HEK293A 세포에서 TM184C를 많이 만들게 한 조건에서 나왔다. bpp 점수는 두 차례의 독립 실험에서 조건마다 관심 영역 28~60개를 모아 계산했다(그림 4). TM184C를 없앤 세포는 너무 약해 현미경 레이저에도 곧 죽어서, 일반적인 결손과 회복 실험 대신 과발현 세포에서 내재성 유전자만 없애는 방식을 썼다.
- 심사 과정에서 빠진 주장. 처음 투고한 원고는 제목부터 TM184C가 mTOR 신호를 조절한다고 내세웠다. 한 심사위원이 세 차례 심사 내내 근거가 약하다고 문제 삼았고, 출판본에서는 mTOR 이야기가 빠졌다(심사 기록).
- 자가포식과 세포 사이 교환이 어떻게 이어지는지, 넘어간 소포가 이웃 세포에서 무슨 일을 하는지는 아직 관찰 수준이다.
열린 질문
- TM184C를 켜는 신호는 무엇이고, 활성 상태의 구조는 GPCR과 얼마나 닮았을까.
- 정답 목록이 거의 없는 드문 대상을 찾을 때, 구조 검색 방법들의 재현율과 거짓 양성을 공정하게 비교하는 기준은 어떻게 세워야 할까.
- GPCR 말고 다른 접힘에도 서열로는 보이지 않는 슈퍼다크 무리가 얼마나 숨어 있을까.
이해 확인
1. 연구진이 TM184C를 GPCR 목록에서 찾지 못하고 구조 검색으로 찾아낸 까닭은?
- TM184C가 사람에게 거의 발현되지 않아 서열 데이터베이스에 없었기 때문이다
- TM184C가 세포막을 일곱 번 지나지 않아 GPCR 분류 기준에서 빠졌기 때문이다
- TM184C의 서열이 알려진 GPCR과 우연 수준으로만 닮아 서열 비교로는 이어지지 않지만, 예측 구조는 로돕신과 같은 7TM 접힘이기 때문이다
- AlphaFold가 TM184C의 서열을 새로 만들어 냈기 때문이다
구조는 서열보다 오래 보존되므로, 서열이 황혼 지대 아래로 떨어진 먼 친척도 모양으로는 알아볼 수 있다. 저자들은 이런 단백질을 슈퍼다크라고 불렀다. TM184C는 여섯 후보 가운데 가장 넓고 높게 발현돼 실험 대상으로 골랐다(본문, 확장 데이터 그림 1a).
2. TM184C가 GPCR의 세 표지 가운데 보인 것과 보이지 않은 것은?
- G 단백질 결합은 뚜렷했지만 아레스틴 결합은 없었다
- GRK 인산화와 아레스틴 결합은 보였지만, G 단백질 결합은 배경 수준을 재현성 있게 넘지 못했다
- 세 표지를 모두 보였고 리간드도 찾았다
- 세 표지 모두 보이지 않았고 모양만 닮았다
세 가지 측정법에서 G 단백질 결합은 배경을 넘지 못했다(그림 2a~d). 반면 GRK2가 붙고 꼬리의 아레스틴 코드가 인산화되며, 인산화 자리를 없애면 아레스틴 결합이 줄었다(그림 2e~l). 그래서 저자들은 G 단백질 대신 아레스틴으로 신호를 보내는 수용체와 닮았다고 본다.
3. 사람 단백질 2,029개에서 정한 비트 점수 30 문턱을 서열 39,808개의 전체 대 전체 비교에 그대로 쓸 때 짚어야 할 점은?
- 비트 점수는 데이터베이스 크기에 따라 달라지므로 문턱 값 자체를 다시 계산해야 한다
- 서열이 많아지면 우연히 문턱을 넘는 쌍이 오히려 줄어든다
- 서열 수와 상관없이 우연히 문턱을 넘는 쌍의 수는 같다
- 비트 점수 자체는 크기와 무관하지만, 우연히 문턱을 넘는 쌍의 기대 개수는 비교하는 쌍의 수에 비례해 약 400배로 늘어난다
관련 없는 두 서열이 비트 점수 S 이상을 낼 기대 횟수는 m×n×2의 −S 제곱이고, 전체 대 전체 비교에서는 쌍의 수를 곱한다. 서열 수가 약 20배면 쌍의 수는 약 400배다. 길이 250을 가정하면 30비트에서 약 120쌍이 약 4만 6천 쌍으로 늘어난다. 일치도 30% 조건이 이 가운데 일부를 걸러 낸다.
논문 정보
- 논문: Kyutae D. Lee 외 21명, “TM184C is a GPCR-like regulator of intercellular exchange and autophagy”, Nature 657(8132), 833-843. 2026년 9월 9일 온라인 게재. doi:10.1038/s41586-026-10993-8
- 해설 기사: Nil Casajuana-Martin, M. Madan Babu, “‘Superdark’ protein looks like a G-protein-coupled receptor, but shows unconventional behaviour”, Nature 657, 608 (2026). doi:10.1038/d41586-026-02472-x
- 데이터: 구조 검색 결과와 분류 목록 Zenodo 10.5281/zenodo.21178101, 예측 구조는 AlphaFold DB
- 코드: github.com/dangerisom/Isom-Lab (Zenodo 10.5281/zenodo.21175708)