같은 결과를 다시 얻지 못하면 무엇을 물어야 할까
한 번 실패한 재현은 원래 연구를 곧바로 지울까?
Biz2Lab 지식 에세이
이야기의 길 따라 6개의 장면
다시 해 보았다는 말의 세 갈래
어떤 실험에서 차이가 나왔는데 다른 연구자가 같은 차이를 찾지 못했다. 이 한 문장에는 서로 다른 사건이 들어갈 수 있다. 원래 자료로 계산했지만 숫자가 달라졌을 수도 있다. 새로운 참여자를 모집했는데 차이가 작아졌을 수도 있다. 다른 나이나 언어권에 적용했더니 예상과 달랐을 수도 있다. 무엇을 다시 했는지에 따라 다음에 확인할 곳도 달라진다.
미국 국립과학공학의학한림원의 2019년 보고서는 용어를 구분해 사용한다. 같은 입력 자료와 계산 단계, 방법, 코드를 사용해 일관된 결과를 얻는 것을 재현성으로, 같은 과학적 질문에 새 자료를 모아 일관된 결과를 얻는 것을 반복 가능성으로 정의한다. 다른 맥락이나 모집단에 적용되는 범위는 일반화라는 별도 문제다. 분야에 따라 단어를 반대로 쓰기도 하므로, 이 구분은 보고서와 이 글의 용례임을 밝혀 둔다. 보고서의 정의 (새 창)
계산이 돌아간다는 확인은 실제 세계의 효과가 반복된다는 확인을 대신할 수 없다. 반대로 새로운 표본에서 차이가 없었다고 해서 원래 계산 파일에 오류가 있다는 뜻도 아니다. 두 문제를 섞으면 원래 연구를 지나치게 보호하거나, 근거 없이 통째로 폐기하게 된다.
원고가 사용하는 National Academies의 구분에 따라 같은 입력과 계산, 새 자료를 통한 반복, 다른 조건으로의 일반화를 나눴습니다. 분야에 따라 용어 사용은 달라질 수 있습니다.
Biz2Lab 편집 개념도 · 원자료의 이미지나 실측 데이터 복제 아님
관련 근거: National Academies, Reproducibility and Replicability in Science, 2019, Summary (새 창)
100건을 다시 조사했을 때
2015년 오픈 사이언스 협업 연구는 세 심리학 학술지에 실린 실험 및 상관 연구 100건을 반복했다. 논문 초록에 따르면 원래 연구의 97%가 통계적으로 유의한 결과를 보고한 데 비해 반복 연구에서는 36%가 유의한 결과를 얻었다. 반복 연구의 효과 크기도 평균적으로 줄었다. 이 숫자는 선정된 연구와 그 반복 방식에 관한 결과다. 심리학 전체에서 64%가 거짓이었다는 계산으로 바꿀 수 없다. 연구의 대상과 결과 (새 창)
논문은 한 가지 숫자만 제시하지 않았다. 원래 효과 크기가 반복 연구의 신뢰구간에 포함되는지, 연구자가 반복되었다고 평가하는지 등 다른 기준도 함께 보고했다. 유의한 결과의 비율과 효과 크기의 일치가 서로 다른 판정이라는 사실이 드러난다. 원래 연구에서 긍정적인 결과가 나왔다는 말과, 새 연구에서 같은 정도의 효과를 정밀하게 확인했다는 말은 같은 문장이 아니다.
연구 100건을 세는 방법도 읽어야 한다. 모집 대상, 수행 조건, 분석법과 판정 기준을 정한 과정이 결과에 영향을 준다. 이 큰 협업은 한 사람이 자기 실험을 반복하는 것과 다른 검사를 가능하게 했지만, 모든 분야의 대표 표본이 되지는 않는다. 널리 알려진 숫자일수록 대상이 생략된 채 이동하기 쉽다.
0.05의 양쪽에서
설명을 위한 가상 예를 들어 보자. 두 연구가 어떤 교육 활동의 효과를 조사했다. 첫 연구는 평균 차이를 4점으로, 두 번째 연구는 3점으로 추정했다. 두 연구의 불확실성 범위가 넓게 겹치지만 첫 연구의 유의확률은 0.04, 두 번째는 0.06이었다고 하자. 이 숫자는 실제 연구에서 가져온 것이 아니다.
0.05를 경계로 첫 연구는 성공, 두 번째는 실패라고 부르면 두 결과가 실제보다 멀어 보인다. 차이의 크기와 추정의 정밀도를 함께 보면 판단이 달라질 수 있다. 반대로 둘 다 0.05보다 작더라도 효과의 방향이나 크기가 크게 다르다면 그 불일치를 설명해야 한다. 유의 여부가 같다는 사실만으로 같은 결과가 나온 것은 아니다.
미국통계학회가 2016년 성명 발표를 알린 보도자료에는 여섯 원칙이 실려 있다. 유의확률은 연구 가설이 참일 확률을 뜻하지 않으며, 효과의 크기나 중요성을 측정하지도 않는다고 설명한다. 결론이나 정책 결정을 임계값 통과 여부에만 맡겨서는 안 된다는 원칙이다. 이 글의 가상 예는 그 원칙을 읽기 위한 것이며 실제 자료에 대한 통계 분석을 대신하지 않는다. 성명 발표 보도자료의 여섯 원칙 (새 창)
불일치가 난 지점을 따라가기
같은 자료를 다시 계산한 경우라면 우선 입력 파일과 제외 기준, 코드의 버전, 프로그램이 실행된 환경을 살필 수 있다. 같은 이름의 자료라도 전처리한 내용이 다를 수 있다. 난수를 사용하는 계산에서는 매번 모든 자릿수가 일치해야 하는지, 허용 가능한 변동 안에서 같은 결론인지도 먼저 정해야 한다. 보고서는 복잡한 계산에서 정확히 같은 수치와 일관된 결과를 구분할 필요를 다룬다. 계산과 정밀도의 구분 (새 창)
새 자료를 모은 경우에는 참여자의 구성, 장비와 측정 방법, 효과가 나타날 것으로 가정한 조건을 비교한다. 조건 차이가 원인 후보라면 그 차이를 바꾸는 추가 조사를 설계할 수 있다. 결과가 다르다는 이유만으로 사후에 가능한 모든 차이를 늘어놓는 것은 설명이 아니다. 어떤 차이가 결과를 바꾼다는 구체적인 예상과 검사 방법이 있어야 한다.
원래 효과를 과대평가했을 가능성도 검토 대상이다. 우연히 큰 값이 나온 연구만 눈에 띄었는지, 여러 분석 중 긍정적인 것만 보고했는지 살펴야 한다. 어느 한 설명을 자동으로 선택하지 않으면서, 검증이 이어져도 주장이 지지되지 않으면 주장과 적용 범위를 줄여야 한다. 불확실성을 말하는 태도가 모든 연구를 영원히 보류 상태로 보호하는 장치가 되어서는 안 된다.
4점과 3점을 비교할 때 남을 표
가령 공개된 표의 단위가 바뀌었는데 계산 설명에는 그 변경이 빠졌다고 하자. 이 경우 다시 계산한 숫자의 차이는 새로운 과학적 현상을 발견한 결과가 아닐 수 있다. 반대로 입력과 계산을 확인한 뒤에도 새 집단에서 차이가 반복된다면 자료 처리만 고쳐서는 해결되지 않는다. 같은 불일치라는 이름 아래 원인과 후속 작업이 갈라진다. 결과를 보기 전에 정한 비교 기준이 남아 있으면 나중에 제시한 설명을 더 명료하게 검사할 수 있다. 새로 떠오른 설명도 그에 맞는 후속 조사로 시험할 수 있다.
논문의 결론을 읽는 사람에게도 실용적인 구분이 있다. 원래 연구가 보고한 효과가 얼마나 큰지, 어떤 대상에서 측정했는지, 그 불확실성은 어느 정도인지, 새 연구가 무엇을 바꾸었는지를 나란히 놓을 수 있다. 요약 기사 두 편의 성공과 실패라는 말만 비교하는 것으로는 이 정보를 얻기 어렵다. 단정적인 제목을 잠시 내려놓고 본문의 방법과 결과를 읽어야 하는 이유다.
한 번의 반복으로 모든 조건을 조사할 수는 없다. 그렇지만 조사 범위가 제한적이라는 설명은 구체적이어야 한다. 언어권이 다르다거나 장비가 바뀌었다면 그 차이가 주장의 어느 부분을 건드리는지 밝혀야 한다. 막연히 사람은 복잡하다고 말하는 것은 어떤 결과도 설명할 수 있어서 다음 연구를 설계하는 데 도움이 적다.
사기는 자료를 꾸미거나 속이는 행위에 관한 문제이며 반복 실패 자체와 동의어가 아니다. 엄밀하게 수행하고 투명하게 보고한 연구에서도 새 자료의 결과가 달라질 수 있다. 한림원 보고서 역시 이를 명시한다. 그렇다고 자료 조작 가능성을 검사에서 제외하라는 뜻도 아니다. 서로 다른 원인에는 서로 다른 증거가 필요하다는 뜻이다.
앞의 가상 학습 연구에서는 4점과 3점이 같은 척도의 점수인지부터 표에 적을 수 있다. 참여자 수와 구성, 두 집단의 비교 방법, 제외된 자료, 효과 추정의 불확실성도 함께 놓는다. 분석을 바꾸었다면 바꾸기 전 결과와 이유를 구분한다. 민감한 개인정보까지 무조건 공개하라는 뜻은 아니며, 자료를 검토할 수 있는 접근 조건을 설명하는 일도 필요하다.
이렇게 놓은 표에서는 0.04와 0.06이라는 유의확률 두 개가 결론 전체를 대신하지 못한다. 학습 효과가 얼마나 비슷한지와 어느 조건에서 달라졌는지를 따로 읽을 자리가 생긴다. 표의 빈칸도 의미가 있다. 반복 연구의 측정 범위가 좁아서 빠진 항목인지, 공개된 보고서에 설명이 없어서 비어 있는지에 따라 다음에 찾아볼 자료가 달라진다. 역사 기록의 빈자리와 같은 종류의 증거는 아니지만, 빈칸을 성공이나 실패라는 말로 덮어 버리지 않는다는 점은 이어진다. 4점과 3점의 거리를 읽는 일은 두 논문에 합격과 불합격을 붙이는 것보다 구체적인 작업이다.
직접 들여다볼 원자료
아래 자료의 근거를 연결해 구성한 에세이입니다. 자료에서 확인한 사실과, 이를 오늘의 질문에 연결하는 원고의 해석을 구분해 읽어 주세요.
- National Academies, Reproducibility and Replicability in Science, 2019, Summary (새 창)
같은 입력과 계산의 재현, 새 자료를 사용하는 반복, 일반화의 구분과 계산 결과의 허용 변동. 엄밀한 연구도 반복에 실패할 수 있다는 설명.
- National Academies, Understanding Reproducibility and Replicability (새 창)
분야에 따라 두 용어를 다르게 사용하는 문제와 자료·방법 공개의 맥락.
- Open Science Collaboration, Estimating the reproducibility of psychological science, 2015 (새 창)
세 심리학 학술지의 연구 100건을 반복한 논문 초록. 전체 심리학이나 모든 과학의 실패율로 일반화하지 않는다.
- American Statistical Association, American Statistical Association Releases Statement on Statistical Significance and P-Values, 2016-03-07, 보도자료 (새 창)
성명 발표를 알리는 공식 보도자료. 둘째·셋째·다섯째 원칙은 유의확률이 가설의 확률이나 효과 크기가 아니며 결정을 단일 임계값에만 맡겨서는 안 된다고 설명한다.