본문으로 건너뛰기
← 이야기 첫 화면

인간의 자리

좋은 설명에는 어디까지라는 말이 있다

틀릴 수 있는 모형을 어떻게 믿고 사용할까?

Biz2Lab 지식 에세이

이야기의 길 따라 7개의 장면

같은 예측, 서로 다른 결정

가상의 박물관에서 예약 인원으로 대기 시간을 예측하는 상황을 생각해 보자. 이후 등장하는 수치도 설명을 위해 정한 값이다. 어느 날 프로그램이 대기 시간을 20분으로 표시했다. 안내 문구를 준비할 때는 그 예측을 참고할 수 있다. 그러나 그 숫자 하나로 현장 직원을 줄이는 결정을 내려도 되는지는 다른 질문이다.

같은 예측이라도 틀렸을 때의 결과가 다르다. 안내한 시간보다 오래 기다린 사람에게 상황을 다시 설명할 수는 있다. 반면 지원할 직원을 줄인 상태라면 문제가 생겨도 즉시 대응하기 어려울 수 있다. 어떤 결정을 위한 예측인지 말하지 않으면 ‘정확한 모형’이라는 표현은 실제로 필요한 검사를 가린다.

모형은 현실의 어떤 관계를 골라 표현한 것이다. 이 박물관의 모형이 예약 인원과 대기 시간만 연결했다면, 예약 없이 오는 관객이나 입구의 작업 방식은 별도의 정보가 된다. 많은 변수를 넣는다고 자동으로 좋은 설명이 되는 것도 아니다. 무엇을 설명하려고 어떤 관계를 선택했는지부터 확인해야 한다.

대기시간 20분이라는 가상 예측을 방문자 안내와 인력 배치의 두 결정으로 나눈 그림
한 예측에서 갈리는 두 결정

원고의 가상 대기시간 20분 사례를 정리했습니다. 방문자 안내와 인력 배치에는 같은 예측 외에도 서로 다른 판단 조건이 필요하며 실제 운영 데이터를 그린 것은 아닙니다.

Biz2Lab 편집 개념도 · 원자료의 이미지나 실측 데이터 복제 아님

관련 근거: NIST, Basic Definitions of Uncertainty (새 창)

첫 질문은 숫자의 출처다

과거의 대기 시간을 어떻게 측정했는지 살펴보자. 줄의 끝에 선 순간부터 계산했는지, 예약 확인 창구 앞에 도착한 때부터 계산했는지에 따라 같은 관객의 대기 시간이 달라질 수 있다. 직원이 수기로 기록한 시각과 장비가 자동으로 남긴 시각을 섞었다면 기록의 기준도 확인해야 한다. 이것은 박물관에서 실제로 발견한 오류를 보고하는 것이 아니다. 측정 대상의 정의가 예측의 입력을 바꾼다는 예다.

NIST의 측정 불확실성 안내는 측정 결과가 입력량들에서 추정되며, 관계식에 물리 법칙뿐 아니라 측정 과정도 표현되어야 한다고 설명한다. 관측자, 장비, 시료, 측정 시점 등의 변동도 고려할 대상이다. 값 옆의 불확실성은 자신감이 부족해서 덧붙인 수사가 아니라 측정 결과를 이해할 정보다. 측정 과정과 불확실성 (새 창)

다만 측정의 불확실성과 모형이 놓친 관계는 같은 문제가 아니다. 시계를 더 정밀하게 맞추어도 예약 없는 관객을 빠뜨린 가정은 남는다. 모형의 입력을 정확히 측정하는 일과 입력만으로 결과를 설명해도 되는지 검토하는 일은 별도로 필요하다. 정밀한 숫자가 반드시 충분한 설명을 뜻하지 않는 이유다.

평일 자료를 주말로 옮길 때

가상의 모형을 만든 자료가 조용한 평일 관람에서 왔다면, 주말 단체 행사에서도 같은 관계가 성립하는지 확인해야 한다. 예약 인원은 같아도 단체 도착의 시간 집중, 현장 접수 비율, 관람객에게 필요한 지원이 다를 수 있다. 여기서 차이를 하나씩 나열하는 목적은 어떤 모형도 쓸 수 없다고 말하는 데 있지 않다. 달라진 조건 중 무엇이 예측을 바꿀 가능성이 있는지 검사를 설계하는 데 있다.

같은 평일 자료로 다시 계산해서 같은 결과가 나오는 검사는 프로그램의 계산 경로를 확인하는 데 도움이 된다. 그러나 그 결과가 새로운 주말 상황에서도 맞는지는 새 관측으로 평가해야 한다. 재계산과 새 환경에서의 검사는 다른 질문이다. 이 차이를 생략하면 계산 재현을 현장 적용의 보증서로 사용하게 된다.

과학적 설명은 자료에 맞는지 검토하면서 적용 범위와 추론을 수정한다. 한림원의 과학적 방법에 관한 장도 증거와 설명을 연결하는 이런 과정을 다룬다. 그 일반 원리가 우리 가상의 모형이 정확하다는 근거가 되는 것은 아니다. 그 모형의 조건에 관한 자료를 따로 확보해야 한다. 과학적 방법과 설명의 평가 (새 창)

주말에 결과가 다르면 평일 자료 전체가 거짓이 되지는 않는다. 평일에도 맞지 않는지, 주말에 추가된 조건에서만 어긋나는지 구분할 수 있다. 검사가 반복될수록 적용 범위를 더 구체적으로 적거나 다른 관계를 모형에 넣을 수 있다. 다만 결과를 본 뒤마다 예외를 덧붙여 어떤 실패도 피하는 설명이라면 실제 예측의 힘이 있는지 다시 물어야 한다.

불확실성을 붙이는 방법에도 근거가 필요하다

20분이라는 예측 옆에 범위를 붙이고 싶을 수 있다. 그러나 얼마를 더하고 뺄지는 화면을 그럴듯하게 만드는 편집 문제가 아니다. 비슷한 조건에서 관측한 변동과 측정 방식, 예측 오차를 검토해야 한다. 평균적인 시간이 들어갈 범위와 다음 관객 한 명의 시간이 들어갈 범위도 같은 대상이 아니다. 이 글은 계산 자료가 없으므로 숫자로 된 예측 구간을 만들어 제시하지 않는다.

NIST는 반복 관측의 통계로 평가하는 방법 외에도 이전 측정 자료, 장비 사양 등 이용 가능한 정보를 통해 불확실성을 평가하는 방법을 설명한다. 무엇을 근거로 범위를 정했는지 밝히는 일이 필요하다는 점을 읽을 수 있다. 다만 측정에 관한 이 안내를 예약 예측의 모든 오차를 계산하는 공식으로 옮길 수는 없다. 다른 정보로 불확실성을 평가하는 방법 (새 창)

또한 범위를 제시해도 모형 밖의 사건까지 모두 포함되었다는 뜻은 아니다. 새로운 현장 접수 방식처럼 기존 자료에 없던 변화는 과거 오차만으로 평가하기 어려울 수 있다. 우리가 얼마나 모르는지 말할 때도 알고 있는 변동과 조사하지 않은 조건을 구분해야 한다. 범위를 넓게 붙여 놓는 것만으로 검증이 끝나지는 않는다.

실행한 뒤에도 조건은 움직인다

가상의 박물관이 주말 평가를 마치고 안내에 모형을 사용하기로 했다고 하자. 이후 예약을 확인하는 창구가 합쳐진다면 같은 예약 인원도 이전과 다른 흐름을 만들 수 있다. 화면의 대기 시간과 새 창구에서 실제로 걸린 시간을 비교할 이유가 생긴다. 안내를 읽은 관객이 계속 다른 줄에서 시간을 잰다면 첫 장에서 정한 대기의 시작점도 다시 설명해야 한다. 이런 변화는 프로그램이 오류 없이 실행되는지만 보아서는 드러나지 않는다.

이런 조건과 운영의 연결은 AI에서도 다뤄진다. NIST의 2023년 AI 위험관리 프레임워크는 사용할 환경과 비슷한 조건에서 성능을 평가하고, 일반화의 한계를 기록하며, 운영 중에도 감시와 대응을 이어가도록 설명한다. 조건별 평가와 운영 중 점검 (새 창) 박물관의 모형이 주말 안내에 쓸 만했는지는 별도의 현장 자료로 판단할 일이다. 창구가 바뀐 뒤에도 같은 안내를 계속할지는 그 다음 판단으로 남는다.

결정의 목표도 확인해야 한다. 대기 시간 평균을 줄이는 것이 목표라면 특정 관객에게 부담이 몰리는 변화가 숫자 밖에 남을 수 있다. 어떤 결과를 좋다고 평가하는지 정하는 일에는 사람의 가치 판단이 들어간다. 프로그램이 계산한 값이라는 이유만으로 그 목표를 중립적이라고 부를 수 없다. 측정 대상, 모형의 관계, 실행 목표는 서로 연결되지만 같은 층위가 아니다.

20분을 안내하는 일과 사람을 배치하는 일

처음 화면의 20분으로 돌아가 보자. 만일 그것이 예약 확인부터 입장까지의 평균 대기 시간 예측이라면 관객에게 그 뜻을 알려 줄 수 있다. 다음 사람 한 명에게 반드시 20분이 걸린다는 약속과는 다르다. 평일만 평가했다면 주말에도 확인한 값처럼 표시할 수 없고, 입장 전의 다른 줄에서 보내는 시간까지 포함한 숫자로 읽히지 않게 해야 한다. 이 구분이 실제 안내 문구를 바꾼다.

직원 배치에는 한 단계가 더 있다. 기존 직원이 일하던 자료로 얻은 20분은 직원을 줄인 뒤에도 같은 시간이 유지된다는 예측이 아니다. 사람이 줄면 처리하는 방식 자체가 바뀔 수 있는데, 예약 인원만 담은 관계에는 그 변화가 표현되지 않았다. 안내에서 오차가 작았다는 결과로 직원 수를 정하면 아직 평가하지 않은 행동의 결과를 이미 확인한 것처럼 사용하는 셈이다. 필요한 것은 원래 예측의 반복 계산보다, 바꾸려는 배치에서 업무와 대기가 어떻게 달라지는지에 관한 근거다.

이 가상 사례에서는 안내를 준비하는 사람과 직원을 배치하는 사람이 같은 화면을 보면서도 다른 자료를 찾아야 한다. 관객에게는 기다릴 시간의 의미와 현장에서 상황을 확인할 곳이 필요하고, 배치 담당자에게는 인원을 바꾸었을 때의 처리 능력과 지원 수요가 필요하다. 반복 연구에서 새 조건을 검사하는 일은 이 구분의 한 부분이다. 20분이라는 숫자는 그대로일 수 있다. 그 옆에 써야 할 설명과 그 숫자만으로 승인할 수 있는 행동의 범위가 달라진다.

직접 들여다볼 원자료

아래 자료의 근거를 연결해 구성한 에세이입니다. 자료에서 확인한 사실과, 이를 오늘의 질문에 연결하는 원고의 해석을 구분해 읽어 주세요.

  1. NIST, Basic Definitions of Uncertainty (새 창)

    측정 결과가 입력량과 측정 과정을 통해 추정되고 관측자·장비·시료 등의 변동을 고려한다는 설명.

  2. NIST, Evaluating Uncertainty Components, Type B (새 창)

    반복 측정의 통계 외에도 이전 자료와 장비 정보 등으로 불확실성을 평가하는 방법.

  3. National Academies, Scientific Methods and Knowledge, 2019 (새 창)

    과학적 설명과 추론을 증거로 평가하는 과정과 수정 가능한 지식. 개별 모형의 성능을 보장하지 않는다.

  4. NIST, Artificial Intelligence Risk Management Framework 1.0, 2023 (새 창)

    28–32쪽의 측정·조건별 평가·일반화 한계·운영 중 감시와 위험 대응. 규제 준수나 인증을 받았다는 뜻이 아니다.

이어 읽는 질문