연구 결과를 “유의했다”와 “유의하지 않았다”로만 나누면 가장 중요한 정보가 빠질 수 있다. 실제 차이가 어느 정도였는지, 그 추정이 얼마나 불확실한지를 알려주는 것이 효과크기와 신뢰구간이다. p값은 특정 통계 모형 아래에서 관찰된 자료의 드묾을 나타내지만, 효과의 크기나 중요도를 직접 말해주지는 않는다.
효과크기는 차이의 규모다
효과크기는 질문과 자료에 따라 평균 차이, 표준화 평균 차이, 위험비, 오즈비처럼 여러 형태로 표시된다. 같은 단위를 쓰는 측정값의 평균 차이는 비교적 직관적이다. 연구마다 측정 도구가 다르면 표준편차를 기준으로 차이를 표준화하기도 하지만, 원래 단위의 감각은 약해진다. 사건 발생 자료에서는 상대 지표와 절대 지표가 서로 다른 면을 보여준다.
가상의 예를 들어보자. 두 집단의 점수 평균 차이가 2점이고 p값이 기준보다 작았다고 하자. 2점이 실제로 체감할 만한 차이인지는 측정 척도와 맥락, 미리 정한 중요 차이 기준을 알아야 판단할 수 있다. 표본이 매우 크면 작은 차이도 통계적으로 유의할 수 있고, 표본이 작으면 꽤 큰 차이도 유의 기준을 넘지 못할 수 있다. 이 수치는 설명을 위한 가상의 값이다.
신뢰구간의 폭이 말하는 것
신뢰구간은 하나의 점추정치 주변에 있는 불확실성을 범위로 보여준다. 흔히 쓰는 95% 신뢰구간은 같은 절차로 연구를 매우 많이 반복할 때 만들어진 구간의 약 95%가 참값을 포함한다는 장기적 성질을 뜻한다. 이번에 계산된 구간 안에 참값이 95% 확률로 있다는 표현과는 엄밀히 다르다.
구간이 좁으면 가능한 값의 범위가 비교적 제한되고, 넓으면 자료가 여러 크기의 효과와 양립할 수 있다는 뜻이다. 표본 수, 사건 수, 측정값의 변동 등이 폭에 영향을 준다. 차이 없음에 해당하는 값을 구간이 포함하는지도 보지만, 경계선을 조금 넘었는지만으로 두 결과를 전혀 다른 것으로 취급해서는 안 된다. 구간 전체가 실질적으로 중요한 차이의 범위에 있는지도 확인해야 한다.
통계적 유의성과 실질적 의미
통계적 유의성은 미리 정한 기준과 분석 가정에 따른 분류다. 연구 설계의 비뚤림, 여러 결과를 반복 검사한 문제, 분석 계획 변경까지 해결해 주지는 않는다. 반대로 유의하지 않은 결과도 ‘차이가 전혀 없음’을 증명하지 않는다. 구간이 넓다면 의미 있는 차이와 차이 없음이 모두 가능할 수 있다.
비율 자료에서는 상대위험과 절대위험을 함께 봐야 효과의 실제 규모를 이해하기 쉽다. 여러 연구를 합친 결과라면 숲그림과 이질성에서 각 연구의 구간과 통합 구간을 나누어 읽는다. 어떤 대상과 결과를 측정했는지는 PICO로 확인할 수 있다.
PeerGist에서는
PeerGist는 p값만으로 효과 유무를 단정하지 않고 효과크기, 신뢰구간, 측정 단위와 적용 범위를 함께 기록합니다. 근거 현황판의 결과 방향도 확실성이나 중요도 자체를 뜻하지 않음을 구분합니다. 분석과 검증 원칙은 방법론에서 확인할 수 있습니다.