근거 위계는 연구 설계에 따라 인과 질문에 답할 때 흔히 생기는 오류의 가능성을 대략 배열한 틀이다. 보통 피라미드 꼭대기에 체계적 문헌고찰과 메타분석, 그 아래에 무작위 대조 시험, 코호트와 환자대조군 연구, 단면 연구와 사례 보고 등을 놓는다. 빠른 길잡이는 되지만 위쪽의 모든 연구가 아래쪽의 모든 연구보다 낫다는 순위표는 아니다.
피라미드가 보여주는 것
중재의 결과를 비교하는 질문에서는 무작위 배정이 알려진 교란과 알려지지 않은 교란을 집단 사이에 분산시킬 가능성을 높인다. 관찰연구는 배정 없이 이미 존재하는 차이를 다루므로 남은 교란을 배제하기 더 어렵다. 이런 설계상의 특징 때문에 RCT가 인과 질문에서 높은 위치에 놓이는 경우가 많다.
체계적 문헌고찰은 정해 둔 방법으로 관련 연구를 찾고 평가하며, 메타분석은 가능한 경우 결과를 수치로 통합한다. 여러 연구를 함께 보면 한 연구에만 기대는 것보다 전체 양상과 불일치를 파악하기 쉽다. 그러나 메타분석은 포함된 연구를 재분석하는 것이므로 바탕 연구의 오류를 없애는 새 실험은 아니다.
질문에 따라 적합한 위계도 달라진다. 드문 결과나 오랜 시간에 걸친 양상, 무작위 배정이 불가능한 노출을 살피려면 관찰 자료가 더 직접적인 근거일 수 있다. 질적 연구는 경험과 맥락에 관한 질문에서 수치 비교와 다른 종류의 답을 제공한다. 먼저 질문을 정한 뒤 그 질문에 맞는 설계를 판단해야 한다.
위계 안에서도 품질은 달라진다
무작위 시험이라도 배정이 노출되고 탈락자가 많거나 선택적으로 결과를 보고하면 비뚤림 위험이 커진다. 표본이 작고 추적이 짧으면 추정도 불안정하다. 반대로 잘 설계된 대규모 관찰연구가 정확한 측정, 적절한 비교, 충분한 추적과 민감도 분석으로 주요 대안 설명을 면밀히 다룰 수 있다. 이 경우 부실한 RCT보다 더 유용한 정보를 줄 수 있다.
연구가 질문과 얼마나 직접 연결되는지도 별도 축이다. 완성도가 높은 연구라도 대상과 비교 조건, 결과가 궁금한 질문과 다르면 적용 가능성이 낮다. PICO로 직접성을 확인하고, 효과크기와 신뢰구간, 결과의 일관성, 출판되지 않은 자료 가능성도 함께 살펴야 한다.
출발점이지 결론이 아니다
근거 위계는 어디부터 읽을지 정하는 지도에 가깝다. 설계 이름을 확인한 다음에는 개별 연구의 수행 품질, 전체 근거의 일관성, 정밀도와 적용 범위를 평가해야 한다. 연구 수가 많다는 사실도 같은 참가자 자료의 중복이나 같은 약점을 공유한다면 확신을 크게 높이지 못한다.
따라서 “메타분석이니 확실하다”거나 “관찰연구이니 쓸모없다”는 식의 판단은 피라미드가 담지 못한 정보를 버린다. 관찰연구의 고유 가치까지 함께 보면 설계마다 답할 수 있는 질문과 남는 한계를 구분할 수 있다.
PeerGist에서는
PeerGist는 연구 유형을 구분하되 위계만으로 품질과 결론을 자동 판정하지 않습니다. 근거 현황판의 수와 별개로 비뚤림 위험, 직접성, 정밀도와 중복 여부를 본문에서 다룹니다. 평가와 집계 기준은 방법론에서 확인할 수 있습니다.