통계와 수학은 늘 머리가 아프고 복잡합니다. 바이오를 하는 사람에게는 특히 낯설고 어렵습니다. 하지만 자신의 데이터가 얼마나 믿을 만한지 설명하려면 반드시 알아야 합니다. 이 강의는 그 어려움을 가볍다고 말하지 않겠습니다. 대신 가능한 한 쉬운 말과 그림으로, 왜 그런 결론에 이르는지 차근차근 설명하겠습니다. 두려움보다는 호기심으로 시작해 주시기 바랍니다.
이 강의를 만든 이유
연구실에서는 숫자를 끊임없이 만납니다. 세포 생존율이 달라지고, 배양 수율이 흔들리며, 처리군과 대조군의 평균이 벌어집니다. 그래프가 그럴듯하게 보일 때도 있고, 예상과 반대로 움직일 때도 있습니다. 우리는 이런 결과를 보며 오랫동안 직관을 길러 왔습니다.
그러나 직관만으로는 다음 질문에 충분히 답하기 어렵습니다.
- 지금 보이는 차이는 실험 조건의 효과인가, 우연한 흔들림인가?
- 평균이 비슷하면 두 조건은 정말 같은가?
- 반복 측정값이 많으면 독립적인 실험도 충분히 많다고 말할 수 있는가?
- 가장 높은 결과를 낸 조건은 재현 가능한 최적조건인가?
- 이 그래프와 숫자는 어디까지 믿고, 어디서부터 의심해야 하는가?
생물통계는 직관을 없애는 학문이 아닙니다. 직관이 어디까지 타당한지 확인하고, 그 판단의 근거를 다른 사람에게 설명할 수 있는 언어로 바꾸는 학문입니다. 우리가 주관적으로 말하던 데이터의 ‘정확성’을 변동, 편향, 반복성, 불확실성, 추정과 검정처럼 관찰하고 비교할 수 있는 기준으로 바꾸는 것이 이 강의의 중요한 목적입니다.
이론에서 시작해 프로그램의 결과로 돌아옵니다
이 강의는 JMP 사용법을 순서대로 외우는 프로그램 강좌가 아닙니다. 먼저 이론과 필수 용어를 설명하고, 작은 숫자와 그림으로 관계를 확인합니다. 그런 다음 질문을 바꿉니다.
그렇다면 이 문제를 실제 데이터에서는 무엇으로 시험하고, 어떤 그림과 결과로 표현할 수 있을까?
이 지점에서 JMP가 등장합니다. 어떤 분석이 이 질문에 대응하는지, 어떤 그래프와 출력이 앞에서 배운 이론을 보여주는지, 그리고 그 결과를 어떻게 읽어야 하는지를 설명할 것입니다. 메뉴와 버튼을 누르는 방법보다 왜 이 결과를 보아야 하며 무엇을 결론으로 삼을 수 있는가에 집중합니다.
강의는 JMP를 중심으로 진행하지만 통계의 원리는 특정 제품에만 속하지 않습니다. Minitab을 사용할 수 있다면 그것도 좋은 방법입니다. 분석의 이름이나 결과 화면 배치는 조금 다를 수 있어도, 표본과 변동을 정의하고 가정을 확인하며 결과를 해석하는 핵심 질문은 같습니다. R이나 Python에 익숙한 분도 같은 이론을 자신의 도구로 옮길 수 있습니다.
두 분야가 서로의 문제를 이해하는 장소
생명공학을 공부하거나 연구하는 분에게 이 강의는 단순한 통계 공식 모음이 아닙니다. 생물학적 반복과 기술적 반복을 구분하고, 데이터의 퍼짐과 실험 단위를 확인하며, 유의성뿐 아니라 효과의 크기와 불확실성을 함께 읽는 훈련입니다. 나아가 여러 조건이 동시에 작용하는 실험, 최적조건 탐색, 공정의 견고성처럼 직관만으로 다루기 어려운 문제를 객관적으로 바라보게 할 것입니다.
AI나 컴퓨터공학을 전공한 분에게는 바이오 데이터가 단지 표 형태의 입력값이 아니라는 사실을 보여주고자 합니다. 하나의 행이 무엇을 뜻하는지, batch와 반복 구조가 왜 중요한지, 측정 오차와 생물학적 이질성이 어떻게 섞이는지, 상관이 왜 곧바로 인과가 되지 않는지를 함께 살펴볼 것입니다. 여기서 발견한 고민이 더 나은 데이터 구조, 시뮬레이션 엔진, 분석 도구, 시각화, AI 모델을 고안하는 계기가 되기를 바랍니다.
두 분야 모두에게 필요한 것은 더 많은 숫자가 아니라 숫자가 만들어진 과정을 이해하는 능력입니다.
실제 데이터 대신 In-Silico Lab을 사용합니다
이 강의에는 공개 실습에 사용할 수 있는 실제 연구 데이터가 없습니다. 설령 실제 데이터가 있더라도 회사·연구·개인·규제 정보가 담긴 원자료를 공개 강의에 그대로 올려서는 안 됩니다. 그렇다고 이미 정답이 정해진 숫자 몇 개만 보고 통계를 배울 수도 없습니다.
그래서 각 단원에는 통계적 생성 규칙에 따라 임의의 결과를 만드는 In-Silico Lab을 함께 구축합니다. 학습자는 조건, 표본 수, 변동, 효과, seed 등을 바꾸어 가상의 실험을 실행하고, 자신만의 합성 데이터 표를 얻을 수 있습니다. 이 데이터는 실제 생물학적 증거가 아니라 통계적 현상을 공부하기 위한 교육용 데이터입니다.
전용 In-Silico Lab은 구현과 통계 검증이 끝난 단원부터 강의 중간에 직접 연결합니다. 아직 검증되지 않은 생성기를 완성된 도구처럼 표시하지는 않겠습니다. 링크가 활성화된 단원에서는 실험실 화면의 안내에 따라 데이터를 생성하면 됩니다.
강의를 따라가는 방법
- 먼저 이론과 그림을 읽습니다. 처음부터 프로그램을 열어 결과표를 만들지 말고, 무엇을 비교하고 왜 비교하는지부터 이해합니다.
- 강의 중간의 In-Silico Lab 링크로 이동합니다. 실험실 안의 설명을 읽고 조건을 선택한 뒤 가상실험을 실행합니다.
- 생성된 표를 보관합니다. Copy 기능을 사용하거나 CSV·Excel 형식으로 내보내어 Excel, 메모장 또는 자신이 편한 분석 환경에 저장합니다.
- 가능하다면 통계 프로그램에서 직접 확인합니다. JMP를 사용할 수 없다면 JMP 공식 무료 체험판을 신청해 강의 기간에 실습할 수 있습니다. Minitab 사용자는 Minitab Statistical Software 공식 페이지에서 같은 통계 질문에 해당하는 분석을 찾아볼 수 있습니다.
- 강의의 기준 결과와 비교합니다. 본문에는 설명을 위한 고정 seed 예시와 대표 JMP 결과가 제시됩니다. 여러분이 생성한 숫자는 다를 수 있으며, 그것이 정상입니다.
- 숫자를 맞히지 말고 패턴을 읽습니다. 어느 조건에서 퍼짐이 커졌는지, 어떤 그래프가 이론에서 설명한 관계를 보여주는지, 결론이 바뀐다면 무엇 때문인지 확인합니다.
프로그램을 사용할 수 없어도 이론과 대표 결과 해석을 따라갈 수 있도록 구성하겠습니다. 다만 직접 데이터를 생성하고 분석해 보면, 같은 공식이 매번 조금씩 다른 숫자 속에서 어떻게 작동하는지 훨씬 분명하게 이해할 수 있습니다.
우리가 함께 지킬 원칙
합성 데이터는 실제 실험 결과가 아니며 연구·임상·품질·규제 판단의 근거가 될 수 없습니다. 프로그램이 내놓은 p-value, 최적조건, 예측값도 자동으로 진실이 되지 않습니다. 실험 단위, 데이터 생성 과정, 가정, 오차, 누락된 정보와 적용 범위를 함께 확인해야 합니다.
이 강의는 복잡한 이론을 감추지 않되, 복잡함을 그대로 독자에게 떠넘기지도 않겠습니다. 공식이 필요하면 왜 필요한지 설명하고, 그림이 필요하면 무엇을 보아야 하는지 표시하며, 프로그램 결과가 나오면 앞의 이론과 다시 연결하겠습니다.
통계는 데이터를 더 그럴듯하게 포장하는 기술이 아닙니다. 내가 아는 것과 아직 모르는 것을 구분하고, 관찰한 차이를 어느 정도까지 믿을 수 있는지 정직하게 말하는 방법입니다. 이 긴 과정을 마쳤을 때 여러분이 숫자를 덜 두려워하는 데서 그치지 않고, 자신의 실험과 데이터에 더 좋은 질문을 던질 수 있기를 바랍니다.