생명과학과 e-Science
Life Science and e-Science

분자설계연구소 곽재식 Jaesik Kwak


1. 유전자와 ASCII 코드 (DNA code or ASCII code)

대중에게 생명과학을 가장 흥미진진하게 소개하는 과학자 중 한 사람인 리처드 도킨스는, 분자생물학과 분자유전학을 뉴턴의 만유인력과 다윈의 진화론과 같은 수준의 업적이라며 추켜 새운 바 있다. 그리고 그는 그 내용을 “생명체의 유전과 진화가 디지털로 되어 있다는 것”이라는 비유로 요약했다.

이러한 그의 설명은 간단하고도 적절한 것이다. 실제로 생명현상의 바탕은 플래시 메모 MP3플레이어나 CDMA 휴대 전화와 다를 바 없다.

우리는 컴퓨터 하드 디스크나 USB 메모리 속에 글, 그림, 음악, 영상 등의 다양한 형태의 자료를 저장할 수 있다. 이러한 다양한 자료들은 자료 자체의 형식과 내용에 관계 없이 모두 일관되게 0과 1의 공통된 디지털 부호로 변환 된다. 그러므로, 하나의 저장장치 속에 서로 다른 정보를 모두 같이 저장할 수 있으며, 모두 같은 방식으로 전송하고 복사할 수 있다.

마찬가지로, 세상의 모든 생명체들은 4 종류의 DNA분자를 부호로 사용하여 그 유전자를 저장한다. 그리고 세상 모든 생명체의 유전자들은 20여 가지의 아미노산 분자 조합으로 발현되어 실제 생명체로 자라나게 된다. “대장금 22부” 동영상과 슈뢰딩거 방정식을 계산하는 프로그램은 동일한 부호로 같은 하드디스크에 저장된다. 똑같이, 세상의 모든 생명체들은 종류를 막론하고 모두 다 4종류의 DNA분자와 20여 가지의 아미노산 분자로 저장할 수 있다. 그 문법과 형식은 완전히 동일하다.

먼 옛날 항우가 타고 다녔던 오추마도, 뉴턴 앞에 떨어졌던 사과도, “포레스트 검프”에서 주인공이 낚던 새우도, 톰 행크스나 저멕키스 감독도, 지구상의 생물인 이상 모두 4종류의 DNA분자의 조합으로 설명할 수 있다. 지금 글을 읽고 있는 독자가 외계인이나 로보트일 가능성을 배제한다면, 글을 읽는 독자 자신도 이점은 마찬가지다. 독자 역시, 가을 하늘의 고추잠자리나, 익어가고 있는 벼이삭과 똑같이, 4종류의 DNA분자 조합으로 설명된다. 이러한 모든 생명체의 근원적인 유사성은 모든 생명체에 영혼이 깃들어 있다는 고대의 애니미즘이나, 유전적 윤회를 구상한바 있는 고대 불교철학을 떠오르게 할 정도로 신비로운 것이다.

그런데, 이처럼 생명체의 유전과 이에 수반되는 수많은 과정들이 마치 숫자와 같은 기호로 설명될 수 있다는 사실은, 또한 필연적으로, 이러한 정보들을 컴퓨터를 통해 처리하기 간편하다는 결론으로 이어진다. 이를테면, “생명체의 유전과 진화가 디지털로 되어 있다는 것”이 밝혀졌으므로, 우리는 디지털로 된 웹문서를 검색엔진에서 검색하고, 디지털로 된 MS엑셀 스프레드쉬트를 계산하듯이, 생명에 관한 정보를 컴퓨터를 사용하여, 대단히 효율적으로 처리할 수 있는 것이다.

실제로 디지털 기능과 생명 정보의 유사성은 놀라울 정도이다. 우리는 생물이 유전자와 아미노산을 이용해서 살아가고 번식하는 과정에서, ZIP을 이용해 파일을 압축하고 압축을 푸는 것과 비슷한 현상을 발견할 수 있다. 우리는 재작년 1월 26일 인터넷 대란 사태를 불러일으켰던 코드레드 계열 웜바이러스와 동일한 작용을 생명체 속에서 발견할 수 있다. 모뎀의 패리티비트를 유전자에서도 찾을 수 있으며, 암세포가 자라나는 모습은 함수포인터를 이용한 무한 재귀호출을 하는 C언어로 짠 컴퓨터 프로그램과 같다.

가히 언어학적이라할 수 있는, 생명정보의 본질적인 분절성과 기호성 덕택에, 이러한 여러가지 구상들은 결론적으로 생명정보학이라는 학문의 한 갈래를 이루게 이르렀다.

이 생명정보학을 통해, 우리는 유전진단을 위한 자료검색에서부터, 인간 게놈 프로젝트에 이르기까지 다양한 분야에 걸쳐 적극적으로, 컴퓨터의 계산 능력을 도입하였다. 이러한 면에서, 1961년, 프란시스 크릭이 DNA분자 기호의 해독법을 알아낸 바로 그 해에, 인텔을 설립한 로버트 노이스가 최초로 실리콘 IC를 개발했다는 사실은, 그야말로 진화론적으로 절묘한 기회라 할만하다. 그리고 그 결과, 현대 유전학의 연구에서 정보기술을 이용해서 생명정보를 검색하고 분석하는 과정을 거치지 않는 경우는, 사실상 없다.

생명정보학이라는 분야의 발전은 그 자체로 생물학과 생리학, 의학과 약학에 크나큰 영향을 미쳤지만 또한 생명과학을 연구하는 많은 과학자에게 컴퓨터와 그 수치적이고 기계적인 분석과 처리의 가치를 일깨워 주는 계기가 되었다. 대부분의 혁명적인 변화가 그러하듯이 생명정보학의 발전은 학문 자체의 결과뿐 아니라, 문화적인 자극을 주어 많은 사람들에게 영감과 도전을 불러일으켰다.

생명정보학은 많은 생명 현상에 관심 있는 사람들에게 컴퓨터를 친숙하게 여기게 하였고, 다양한 컴퓨터의 활용법과 소프트웨어 개발법에 익숙해지게 했다. 반대로 복잡한 자료의 해석을 위해 컴퓨터를 활용해야만 했던 화학과 물리학의 연구자들이 생물학과 유전학에 관심을 갖는 계기를 만들어 주었다. 어느 시대, 어느 분야에서도 그러하듯이, 연구태도와 연구자들의 관습에 대한 이런 변화들은, 애초에 정보기술의 생명정보처리능력 못지 않게 중요한 진보를 이루어 내기도 했다.

이상의 다양하고도 심도 있는 발전 양상은 결국 생명과학 분야의 제반에 있어서 전산 작업이 밀접하게 자리잡도록 하였고, 생명과학이 그 어떤 학문의 분야 못지 않게 컴퓨터와 정보기술의 활용이 고도화 되도록 하였다. 현대 생명과학이 정보기술과 정보처리 능력에 대해 갖는 위상은 2차 대전 당시 암호 해독 기술이나, 1960년대의 선형 계획법과 회귀분석 연구를 능가한다 할만하다.


그림 1 리처드 도킨스 (http://www.houghtonmifflinbooks.com)



2. 주술과 산술 (Superstition or Supercomputer)

이피게네이아의 이야기는 르네상스 시대의 많은 화가들에게 영감을 주었다. 고대 그리스 비극에 언급되곤 하는 이 여인은 결혼식의 신부 차림을 하고 결혼식이라고 생각하며 사형대로 나아가게 되는 기구한 상황에 빠지는 인물이다. 사연인즉, 트로이를 공격하기 위해 집결한 그리스의 함대에 갑자기 이유 없이 바람이 불지 않자, 아르테미스 여신이 노했기 때문이라는 소문이 돌았던 것이다. 그리하여 아르테미스 여신을 달래고자 그 제물로 이피게네이아라는 아가멤논 왕의 양녀를 바치게 된다.

같은 사건을 다룬 고대 그리스의 서사시 일리아드에는 크리세이스와 브리세이스라는 여인에 대한 언급도 있다. 트로이를 포위하고 대치중인 그리스군 진중에 이유를 알 수 없는 전염병이 돌자, 이번에는 아폴론 신이 노했기 때문이라는 소문이 퍼졌다. 그리하여 아킬레우스와 아가멤논은 아폴론 신전에서 붙잡아 노예로 삼았던 크리세이스와 브리세이스라는 두 여인을 자유인으로 풀어주며, 아폴론 신께 사죄하고자 한다.

이처럼, 환원적으로 풀기 어려운 문제에 대해서 그 이유와 원인, 해결책을 찾는 일은 고대로부터 계속되어 왔다. 이러한 문제는 현대에도 여전히 중요한 고민 거리 중에 하나이며, 복잡한 생명 현상의 여러 신비한 현상들은 그 대표적인 대상이다. 물론 현대 생명과학에서는 어떤 병과 그 치료제의 인과관계를 설명하기 위해 진중에 떠도는 병사들의 흉흉한 소문을 듣는데 치중하지는 않는다. 그보다는 다양한 수치적 분석 방법과 전산 작업을 통한 통계 처리를 활용하게 된다.


그림 2 이피게네이아, 다비드 작품

생명체에 약으로 사용되는 어떤 화학 물질이 왜 약효를 띠는가를 분석하기 위해, 우리는 흔히 그 화학 물질의 여러 가지 다양한 특성들을 계산하고 측정하여 통계적인 추측을 시도한다. 우리는 전통적인 회귀 분석 방법을 사용할 수도 있고, 20세기 후반에 급속한 발전을 이룩한 진화적 알고리즘을 활용할 수도 있다. 근래에는 인공지능과 기계학습의 다양한 방법들이 생명체와 화학물질의 상호관계를 연구하는 도구로 사용되고 있다.

최근 스티븐 더브너와 스티븐 레빗은 “20년전 낙태 권리에 대한 한 재판 결과가 결국 현재 뉴욕시의 범죄율 감소를 가져 왔다”고 주장했다. 그들은 방대하고도 다양한 인구 통계에 기초해 언론과 출판에 정보를 제공하면서 대중적인 반향을 불러온 바 있다. 마찬가지로, 어떤 화학 물질은 약이 되고, 어떤 화학 물질은 독이 되는지 보다 설득력 있게 추측하기 위해서는, 보다 많은 화학 물질들에 대해 체계적이고 일괄적인 대량 계산이 요구 된다.

통상적으로 약으로서 가능성이 있다고 판단되는 화학 물질들은 1~3만 종 사이이며, 실험실과 화학회사에서 우리가 획득할 수 있는 지상의 모든 일반 화학 물질들을 대상으로 할 경우, 분석 해야 할 물질의 가짓수는 200만~800만 종 정도로 확대 된다. 화학 물질의 성질과 생리활성, 약효간의 다양한 인과관계를 추적하여 새로운 약을 예측하고, 미지의 질병에 대처하는 작업은 이러한 방대한 화학 정보와 생물 정보간의 관계를 처리하는 작업이다.

800만이라는 숫자는 뉴욕 시민 전체의 인구와 비슷한 숫자이다. 비유컨데, 약으로 사용할 수 있는 화학물질을 전산 작업을 통해 분석하는 과정은, 뉴욕 시민 개개인 한 명 한 명에 대한 다양한 특징들을 처리하여 종합하는 과정과 같은 분량이다. 메트로폴리탄 오페라 극장의 조명 담당과 브라이언트 파크의 노숙자, 월스트리스트 지하철 역에 쏟아지는 수많은 통근 승객들, 힐러리 로댐 클린턴 상원의원을 포함하는 모든 사람들의 다양한 특징들을 하나 하나 추적하고 연결 지워 보는 작업과 같다.

이러한 모험적인 시도는 최근 고성능 컴퓨터가 저가에 널리 보급되면서 이미 신약개발 일반에 깊숙이 자리 잡았다. 또한 앞서 언급한 생명 현상 간의 본질적인 공통성 때문에, 화학물질에 대한 통계적인 분석 작업 외에도, 단백질과 유전자를 대상으로 하는 대수학적이고 기하학적인 다양한 자료의 처리 작업들이 이미 보편화 되어 있는 상황이다.

따라서, 최근의 기술은 이러한 작업을 선형적으로 진보시켜, 더 효율적으로 관리되는 전산 자원을 통해 더 빠르고 정확한 결과를 얻는 방향으로 발전해 나가고 있다. 당연히 대량의 정보 자료를 통합적으로 관리하고 공유하기 위한 데이터베이스 기술의 발전 또한 병행되고 있으며, 많은 자료를 계산하는 효율을 높이고자, 고성능, 고처리, 고가용 전산 기술의 다양한 영역이 도입 되고 있다.

미국의 NIH가 보유한 다양한 화학물질과 유전체에 대한 데이터베이스와 일본 AIST가 보유하고 있는 대규모 전산 자원은 그 대표적인 예가 된다. 우리나라에서도 KISTI의 ChemDB를 비롯하여, 대량의 관련 정보를 공개적으로 운용하는 예가 있다.


그림 3 KISTI ChemDB 웹사이트



3. 열쇠 찾기와 자물쇠 찾기 (Finding The Key or Finding The Lock)

전산 기술의 발전과 학제에 걸친 연구자들의 노력은, 대량의 효율적인 전산 자원으로 기존에 수행하던 작업의 속도와 분량을 향상 시킨바 있다. 이러한 선형적인 향상이 일정 수준 이상에 도달하면서, 이제는 전산 기술의 발전을 통해 이전과는 다른 몇몇 혁신적인 연구에 도달할 수 있는 시도들이 나타나고 있다.

1990년대에 샷건 방법을 통한 게놈 프로젝트의 극적인 전개는 그 상징적인 사건이었다. 대용량 컴퓨터를 사용하게 되면서, 단지 예전에 할 수 있었던 작업을 빨리 해결할 수 있게 된 것 뿐 아니라, 예전에는 상상하기 어려웠던 해답을 찾기 위해 도전할 수 있는 경우가 제시된 것이다.

구조 유전체학의 다양한 분야와 화학 유전체학의 여러 분야들이 그 대표적인 예시가 될 수 있는데, 그 가장 전형적인 형태로 꼽을 수 있는 것 중 하나가 대량처리를 통한 역(reverse) 스크리닝, 역(reverse) 도킹 계산 작업이다.

황제내경과 히포크라테스 이후, 생체와 질병에 관한 연구는 대체로 생체의 기능이나 질병의 원인을 밝히고, 이후에 다양한 물질들 중에서 약이나 신체에 영향을 끼치는 물질을 찾아내는 단계로 이루어졌다. 이러한 전통은 몇몇 예외적인 경우를 제외하고 극히 최근까지 변함이 없는 생체활성에 대한 연구의 상식이었다.

그런데, 먼저 치료할 질병을 정하고 질병에 관여하는 세포와 단백질을 발견한 뒤, 그것을 조절할 수 있는 화학물질을 찾아내는 이러한 상식적인 연구 방향을 완전히 뒤집어 보는 것이, 역 스크리닝과 역 도킹을 통한 연구 작업이다. 이 과정에서 우리는 먼저 치료할 질병을 정해 두고 그 약을 찾아내는 것이 아니라, 애초에 먼저 약을 정해 두고 연구를 시작하게 된다.

약으로 사용될 화학 물질을 먼저 설정해두고, 이 화학물질과 반응할 가능성이 있는 단백질과 유전자를 탐색해 나가는 것이 이 연구의 주된 과정이다. 분야에 따라 수백종의 단백질로 제한 될 수도 있고, 경우에 따라서는 수천 수만의 유전체를 대상으로 검색작업을 해야 할 수도 있다. 결국 연구 작업의 결과로 얻게 되는 것은 애초에 시작한 약과 반응하게 되는 생체 기능이 되고, 우리는 이를 역추적하여, 이 기능을 조절하면 어떤 질병을 치료할 가능성이 있는지 찾아 낼 수 있게 된다.

이러한 작업은 결국 부작용이 없고 생산이 쉬운 물질을 가지고, 혹시나 이 물질이 어떤 병이든지 간에 무슨 병의 약이 될 수 있지 않을까 알아보는 작업이다. 전통적인 연구 방식을 신약개발(drug discovery)이라고 한다면, 이 작업은 신병개발(disease discovery)라 부를만 하다. 극히 대량의 전산자원을 투입함으로써, 한 가지 약물 후보 뿐만 아니라, 수백, 수천종의 약물에 대해서도 이러한 탐색작업을 수행할 수 있고, 이를 통해서 화학물질-질병의 가치있는 쌍을 찾을 가능성 또한 증가시킬 수 있다.

특효약을 찾아내는 위와 같은 이상적인 연구 방향 외에도, 이러한 역 도킹, 역 스크리닝 연구 방법은 보다 기초적인 단계에서 다양한 가능성을 갖고 있다. 우리는 이미 경험적으로 혹은 임상적으로 약효가 관찰되었지만 그 정확한 반응 과정이나 원리를 모르는 약물을 대상으로 이와 같은 작업을 시도해 볼 수 있다. 그렇게 되면, 그 약물이 어떤 단백질, 어떤 유전체와 관련이 있고, 신체의 어느 기능과 관련하는지 파악할 수 있게 된다. 결론적으로 약물의 원리를 파악하여, 더 효율적인 질병 치료방법에 대한 지식을 줄 수 있을지 모른다.

마찬가지로 우리는 약물 뿐만 아니라, 신체에 해로운 것으로 알려진 독성 물질에 대해서도 같은 연구를 수행할 수 있다. 이를 통해 우리는 신체의 특정 부위가 손상되는 원인과 독물이 신체의 어떤 부분과 반응하여 해를 끼치게 되는지를 알아 낼 수 있게 된다. 이러한 결과를 바탕으로 우리는 독성을 약화시키는 방법이라든가, 이미 독성에 해를 입은 생체 기관을 해독하는 방법을 탐구할 수 있을지도 모른다.


그림 4 HG2C 개념도

보다 원론적인 차원에서 이같은 유전체와 화학물질에 걸친 대량 연구 작업은, 단백질과 유전자의 계통을 결정하거나 진화론적인 연관관계를 밝히는 도구가 되어 줄 수가 있다. 같은 물질에 대해 비슷한 특성을 갖고 있는 것으로 검색된 단백질들은 그렇지 않은 단백질들과 구분할 수 있다. 두 단백질과 그 유전체간의 관계를 비교 분석함으로써, 우리는 진화의 결정적인 방향을 발견하거나 발생학적인 요점을 따져 볼 수 있을 것이다. 나아가 이러한 정보를 종합하여 미지의 단백질과 유전체에 대한 기능에 대해 추측해 볼 수도 있을 것이다.

이상과 같은 연구 방법은, 최근 대용량 전산 자원을 활용하고자 하는 많은 국가적인 시도를 통해, 유럽과 중국, 일본에서 활발히 이루어지고 있으며, 구조 유전체학의 발전과 병행하여 많은 개척적인 시도들을 살펴 볼 수 있다. 우리나라 역시 그리드 컴퓨팅을 도입한 Human Genome To Chemical (HG2C) 연구가 진행되는 등, 여러 성과들을 살펴 볼 수 있다.



4. 성당과 시장 (Cathedral or Bazaar)

생명 과학 분야의 산업적 활용이 다른 분야와 가장 결정적으로 다른 점은 그 실험의 절대적인 중요성이다. 우리는 인공위성을 발사하고, 해왕성에 근접하는 우주선을 보내는 작업을 지상에서의 계산과 예측에만 의존하여 해낼 수 있다. 가끔 2001년에 밝혀진 바와 같이, 미터와 피트 단위간의 변환을 잘못하여 수천만 달러짜리 화성탐사선을 박살낸 적과 같은 실수를 할 때도 있지만, 대체로 우리는 이론과 계산의 힘을 신뢰하며 그에 따라 전투기를 설계하고 다리를 건설한다.

그러나 생명 과학 분야로 넘어오게 되면, 가장 간단한 무좀약조차도 동물 실험 없이 발매할 수 없다. 그것은 인체와 생명의 가치가 본질적으로 다른 재화와 견주어질 수 없다는 우리의 믿음에 근거하고 있기 때문이며, 따라서 생명 과학 연구는 그 어떤 첨단 과학의 연구 분야 보다도 실제적인 노동과 반복적이고도 구체적인 시험을 필요로 한다. 결국 생명 과학 분야는 다양한 세부 분야로 나뉘어져서 각 연구자들이 저마다 독특한 전문 분야를 갖고 연구하면서 발전해 오기도 했고, 현재에 이르러서는 방대하고도 다양한 수많은 정보들을 각급 연구기관이 축적하게 하였다.

이상과 같은 생명과학의 독특한 특성 때문에, e-Science는 또다른 중요한 의미를 갖게 된다. e-Science의 대표적인 발전 방향인 전산 작업의 대량화와 효율적인 통합은, 단지 계산 성능의 발전 뿐만 아니라 또다른 방향에서 이렇게 전문화된 기관간의 협업과 공유, 교류와 연결을 유도한다. 전문화된 다양한 단체들이 갖고 있는 여러가지 정보와 자료들이 서로 상호 협동적으로 통합되어, 새로운 생각들이 보다 빠른 속도로 떠오르고 퍼져 나가게 된다.

옛날 중국 전국시대 말기의 여불위는 “여씨춘추”를 편찬하면서, “이 책에 한 자라도 더 보탤 수 있는 자가 있다면 천금을 주겠다”라고 선언 했다. 그런데, 포털 사이트 네이버의 한 국회의원의 호텔 스캔들을 다룬 기사에는 2만 3천여개의 독자의견이 달려 있다. 인터넷과 전산 작업을 통한 정보 교류는 정보의 수용과 가공, 재생산 양상을 완전히 변화시켰다.


그림 5 Open Source Conference 2000에서 "시장과 성당"의 저자 에릭 레이몬드와 그의 동료

이미 생명 과학 연구를 위해 대규모 데이터베이스가 필요로 하며, 이를 처리하기 위한 다양한 연구 방법들과 대규모의 전산 자원이 필요함을 언급한 바 있다. 또한 이러한 대규모 자원을 활용해서, 이전과는 전혀 다른 새로운 연구를 시도하는 상상력과 창의력이 필요함 또한 언급한 바 있다.

따라서, 특정한 전문 분야를 구성하는 개개의 구성원들이 개방된 정책과 선도적인 운영방식에 따라 서로 통합될 수 있다면, 이러한 전문적이고도 고도화된 정보를 마치 한 군데서 동시에 보유하고 있는 것처럼 유기적으로 연결할 수 있게 된다. 이렇게 되면 간단한 협업을 위해 인적으로, 물적으로 복잡한 절차를 거쳐야만 했던 기존의 연구방식 보다 훨씬 더 자유롭고 신속한 연구 수행이 가능하게 된다.

이러한 전문 연구기관의 대규모 자원 합동은, 데이터 그리드 기술이나, 웹서비스에서 인터넷 커뮤니티, CORBA 모델에 이르기까지 다양한 단계의 원격지간 분산 처리 기술이 그 바탕이 될 수 있다. 이러한 원격지간의 정보 통합을 통한 동적인 교류는 학제적 연구가 빈번하고, 전문분야와 그 연구결과가 특화되어 있는 생명과학 분야에서는 매우 바람직한 발전 방향이다.

기본적으로는, 인간 게놈 프로젝트의 정보체계나, 널리 알려진 The RCSB Protein Data Bank의 운영을 그 원시적인 한 형태로 생각할 수 있겠으나, 이러한 학제간 기관간의 정보 협동 체계는 세계적으로도 시작 단계에 머물고 있다. 중국의 대학간 정보 자원 연결 노력들이나, 대만에서 SARS에 대한 대응체계를 위해 이루어진 각급 기관 간의 정보 통합은 비슷한 방향의 생명 과학의 정보 체계 교류 방안이라 할 수 있다. 그 개방성의 측면에서 성격은 다르긴 하나, 최근 추진되고 있는 미국의 의료 기록 통합 전산화 작업, 역시, 정보 통합의 필요를 역설하는 계획이다.



5. 낮은 곳의 미래와 높은 곳의 미래 (Future From A Bottom or Future From A Top)

e-Science를 비롯한 도전적인 학제간 연구는 대부분 그 초기에 상호간의 교류 부족과 이해 부족으로 어려움을 겪게 된다. 현재 그리드를 활용하고, 전산 자원을 통합해 원격지 연구를 수행하려는 생명 과학 연구자들에게 가장 큰 문제점은 역시, 이러한 고도로 조율된 프로그램을 작성하고 관리하고 설계하는 일이 기술적으로 아주 배우기 어렵고 불편하다는 점이다.

작년부터 교류중에 있는 알버트 아인슈타인 연구소의 하르트무트 카이저 연구원은 그의 발표자료에서 파일 하나를 복사하는 작업을 예로 든 적이 있다. 단 한 줄의 유닉스 명령어를 활용하는 이 작업을 위해서, OGSA 체계를 도입한 그리드를 사용할 경우 우리는 90여줄의 복잡한 코드를 작성해야 한다. 보다 단순한 Globus 2.5 미들웨어를 사용한다고 해도, 우리는 50여줄이 훨씬 넘어가는 극히 이해하기 힘든 코드를 만들어야만 한다.

이러한 불편함은 응용 프로그램의 작성에 가장 큰 문제점이다. 생명 과학에 이용되는 프로그램들은 그 종류와 형태가 매우 다양하고, 용도와 목적에 따라 더욱 다양하게 활용된다. 이러한 프로그램들을 각자 전문분야가 다른 생명 과학 연구자들이 현재 상황에서 자유로운 개발 환경으로 사용하기에는 무리가 따른다. 이렇게, 확장과 연결, 교류가 지극히 제약되어 있는 현재 상황에서, 단지 접속을 위한 웹 포털 사이트를 만들고, 억지로 돌아가는 웹 애플리캐이션 몇 개를 브라우저 위에 띄우는 작업은 사실상 무의미할 수 있다.

따라서, 최근의 동향은 스크립트 차원에서 간단하게 연구자들이 불러 사용할 수 있는 API와 작은 유틸리티 프로그램을 개발하는 작업으로 그 추세가 옮겨 가고 있다. 이처럼 사용하기 간단하며, 구조 또한 간단한 보조 도구를 사용하여, 간단하게 대용량 작업을 수행하도록 하는 것이 e-Science를 이용한 도전적인 연구의 한 방향으로 자리잡았다.

또 다른 e-Science의 한 가지 발전 방향은, 분산처리와 원격지 협업을 통한 전산 작업이 이처럼 불편하고 골치 아프다는 점을 오히려 전복하는 발상이다.

지난 봄, 캘리포니아의 한 학회에서 교류하게 된 인텔의 한 연구원은 사석에서 예전에 자신이 근무하던 마이크로소프트 사의 근무환경에 대해서 이런 저런 이야기를 한 적이 있었다. 그가 밝힌 여러 가지 사안 중에 소개할만한 것은, 마이크로소프트의 업무 지원에 관한 것이었다.

온 정신을 집중하여 개발에 몰두하고 있는 개발자에게 갑자기 컴퓨터가 다운되어 버린다거나, 멀쩡하게 잘 돌아가던 인터넷 클라이언트가 먹통이 되는 것 만큼 답답한 일은 없다. 갈길이 구만리 같아서 밤샘 작업을 각오하고 있는데, 무슨 연유에서 인지 컴퓨터가 부팅이 되지 않고 꼭 사용해야하는 개발도구가 갑자기 문제를 일으키는 일은 개발자를 한없이 괴롭게 한다. 그리하여, 우선 컴퓨터를 고치기 위해 OS 설치 CD와 컴퓨터 케이스를 분해하기 위한 드라이버를 들고 밤새도록 헤메었던 경험은, 컴퓨터를 이용하는 모든 엔지니어들이 한 번쯤은 겪었던 일이다.

마이크로소프트에서는 그와 같은 일이 발생하면, 즉시 어떠한 질문도 없이, 그 컴퓨터를 수거해 가며, 임시로 사용할 수 있는 정상적인 다른 컴퓨터를 내어 준다. 그리고, 예전에 작업하던 자료를 그대로 사용할 수 있도록, 하드 디스크를 떼어서 연결해 주며, 임시로 사용하게 한다. 그리고 그 동안 그 컴퓨터의 복구에 대해 가장 전문적인 전문가들이 신속히 예전의 컴퓨터를 복구해서 되돌려 준다. 개발자들은 개발 작업 자체와 관련 없는 잡다한 컴퓨터 관리에 일체의 고민을 할 필요가 없다.

생명 과학 연구의 분야에서도, 다양한 낯선 기종의 컴퓨터를 다루고 생소한 프로그램들을 설치하고 관리하기 위해 초보적인 연구원들이 불편함을 겪는 일은 항상 일어 난다. 특히 생명 과학과 관련된 프로그램들은 사용자 편의성 보다는 학문적인 가치와 계산 자체의 효율성을 위해 설계된 것들이 많기 때문에 더욱 관리하고 다루기 어렵다.

더군다나, 컴퓨터를 사용하면서 항상 겪어야 하는 OS관리 문제, 보안 문제, 라이브러리와 보조 프로그램의 설치 문제, 백업에 대한 대비는 여전히 귀찮고 힘든 일 중에 하나다. 특히 복잡하게 꼬여 있는 워크스테이션 시스템의 그래픽/네트워크 관련 설정들과, OS버전과 컴파일러 버전과 옵션, CPU, 코프로세서에 대한 고민을 항상 해야 하는 원시 프로그램 설치 작업은, 지극히 원시적인 작업임에도 불구하고, 경력과 경험이 풍부한 인력이 감당하는 수밖에 없다.

거기에 얼마전의 AMD 애슬론 프로세서의 발열 문제 따위의 깨닫기 힘든 하드웨어 문제가 겹치면 생명 과학 연구원들의 전산 자원 관리와 프로그램 다루기는, 정작 고민해야 하는 생명 과학 문제 자체 이상으로 골치 아픈 작업이 되어 버린다.

불편한 것이 문제되었던 e-Science의 분산 처리 기술들과 그리드 컴퓨팅의 문제점들은 도리어 이러한 간단한 문제들을 해결하는 한 방안이 되어 줄 수 있다.

즉, 각각의 프로그램을 사용하는데 능숙한 기관이나 업체에서 그 프로그램 수행의 유지 보수를 전담하며, 항상 그 프로그램의 원할한 실행을 보장하게 된다. 그러면, 연구원들은 스스로 프로그램을 설치하고 관리하기 위해 고민하는 대신에, 전문 기관이 제공하는 원격지 프로그램을 사용하며, 자료는 데이터 그리드를 위해 제3의 원격 저장지에 별도로 보관하여 업무를 수행할 수 있다.

이러한 형태의 위탁 사용이 보편화되고 개방적으로 자율화 되면, 더 이상 생명 과학 연구를 위해 컴퓨터를 사용하는 연구원들은, 겨우 연구 경력을 시작한 학생에서부터, 신기술에 이해가 부족할 수 있는 원로 연구원들에 이르기까지, 모두 정말로 의미있는 처리 작업과 과학적인 계산 작업에만 몰두할 수 있게 된다. 단지 관리가 간편해 질 뿐만 아니라, 전문적인 관리자들은 해당 프로그램에 대해 최신의 기술과 고도의 성능 최적화 작업을 하는데 유리하므로, 보다 양질의 프로그램을 활용할 수 있게 되는 것이다.

이러한 변화는 기술의 발전에 따른 필연적인 양상이다. 수십년 전만해도, 이공계 대학에서는 사칙연산을 위해 계산자를 능숙하게 다루는 법을 익혀야 했고, 수세기 전 극동에서는 문자에 대한 기록과 판독을 정확하게 하는 것이 관료의 가장 중요한 소임이었으므로, 문자 기록과 판독이 팔고문과 같은 문학의 영역과 서예와 같은 미술의 영역으로 심화되기 까지 했다. 어셈블리어 코드들과 펀칭카드에 고민했던 시기가 지나간 것과 같이, 생명 과학 연구자들이 OS 새 버전을 설치하기 위해 낑낑거리는 것도 지나간 일이 될 것이다.

e-Science의 발전은 새로운 생명 과학의 경지를 개척하고 보다 대량의 정보를 가공하여 도전적인 새로운 과학의 영역으로 진출하는 것과 함께, 또한 이처럼 생명 과학 연구자들의 고충을 해결하고, 전산 작업의 경험이 부족한 생명 과학 연구자들을 차근차근 도와주는 소규모 처리에 대한 기술 개발 또한 병행되는 상황에 있다.

데이터 그리드를 본격적으로 상품화한 Oracle 10g의 솔루션도 기본적으로 같은 방향을 지향하고 있으며, Swiss-Model 사이트와 같이, 공개 일반에게 간단한 연구 작업을 서비스하려는 다양한 시도들 역시 이러한 방향을 따르고 있다 하겠다.


- 참고문헌 -
1. Liu Y, Luscombe NM, Alexandrov V, Bertone P, Harrison P, Zhang Z & Gerstein M. 2002. Structural genomics: a new era for pharmaceutical research. Genome Biology 3:4004.1-4004.3
2. Montelione T, Anderson, S. 1999. Structural genomics: keystone for a human proteome project. Nature Struct. Biol. 6:11-12.
3. Stevens R, Norvell J, Wemmer D, Hendrickson W. 2002. April 5. Structural Genomics: A New Field Unfolds. from webcast, InFocus, Bio.com.
4. Stevens RC, Yokoyama S, Wilson IA. 2001. Global efforts in structural genomics. Science 294:89-92.
5. Yang JK, Park M, Waldo GS, Suh, SW. 2003. Directed evolution approach to a structural genomics project: Rv2002 from Mycobacterium tuberculosis. Proc. Natl. Acad. Sci. USA 100:455-460.
6. Jaesik Kwak, Yoon Sup Lee 2005. A computational Grid system for quantum chemical calculations tested in a modeling of the Ge(001) surface ". Journal of Theoretical and Computational Chemistry 4(1), 289-303