조회 수는 독자의 마음을 알고 있을까
- 확률과 통계로 읽는 숫자의 이면
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
이번 시리즈 칼럼의 첫 글에서 종이의 ‘부수’가 디지털의 ‘행동 데이터’로 바뀌었다는 이야기를 했습니다. 그렇다면 그 숫자들은 독자의 마음을 얼마나 알고 있을까요?

디지털 언론은 독자의 행동을 숫자로 바꿉니다. 조회 수, 체류 시간, 완독률, 재방문율, 구독 전환율이 거의 실시간으로 집계되지요. 숫자는 분명합니다. 10만 회는 2만 회보다 크고, 완독률 70%는 20%보다 높습니다. 그러나 계산이 명확하다고 해석까지 명확한 것은 아닙니다. 이 숫자들을 어떻게 읽어야 하는지, 여러분이 배우는 확률과 통계의 눈으로 따져 봅시다.

지표마다 보여 주는 것이 다릅니다. 조회 수는 글이 얼마나 많은 사람에게 도달했는지를, 완독률은 그중 얼마나 깊이 읽혔는지를, 구독 전환율은 돈을 낼 만큼 가치를 느꼈을 가능성을 나타냅니다. 이를테면 어떤 글을 1만명이 열어 7000명이 끝까지 읽었다면 완독률은 70%, 그 가운데 150명이 구독했다면 전환율은 1.5%이지요. 조회 수가 규모를 말한다면, 완독률과 전환율은 행동의 강도를 말하는 셈입니다.

두 글을 비교해 봅시다.
조회수 완독률 구독 전환율
글A 100,000회 18% 0.2%
글B 20,000회 76% 3.5%

글 A는 B보다 다섯 배 많이 읽혔습니다. 광고 노출이 목표라면 A가 성공작이겠지요. 그러나 B를 읽은 독자는 훨씬 높은 비율로 끝까지 읽었고 유료 구독으로도 이어졌습니다. 충성 독자 확보가 목표라면 B가 더 값집니다. 성공의 기준을 무엇으로 잡느냐에 따라 성공한 글이 달라지는 것입니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
표에서의 구독 전환율에는 확률과 통계의 개념이 숨어 있습니다. 이 값은 이렇게 구합니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
전체 독자를 놓고 따지는 것이 아니라, ‘그 글을 읽었다’는 조건을 만족하는 사람들 안에서만 구독한 비율을 따진 것이지요. 조건이 먼저 주어지고 그 안에서 확률을 재는 것, 이것이 바로 확률과 통계에서 배우는 조건부확률이라 하고, 다음과 같이 나타냅니다.

글 A를 읽은 사건을 A, 유료 구독을 시작한 사건을 S라 하면
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
입니다. 세로줄 오른쪽의 A가 이미 주어진 조건이고, 왼쪽의 S가 그 조건 아래에서 따지는 사건이지요. 그러니 이 분수는 앞에서 본 글 A의 구독 전환율과 똑같습니다. 글 B를 읽은 사건을 B라 하면, 앞의 표는 그대로
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
로 읽힙니다. 언론사가 매일 들여다보는 지표가 사실은 교과서 속 조건부확률이었던 셈입니다.

여기서 조심할 것이 있습니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
는 방향이 다르고 값도 다릅니다. 앞의 것은 ‘글 A를 읽은 사람 중 구독한 비율’이고, 뒤의 것은 ‘구독한 사람 중 글 A를 읽은 비율’입니다. “구독자의 80%가 경제 글을 읽었다”는 통계가 곧 “경제 글을 읽으면 80%가 구독한다”는 뜻이 아닌 까닭이 여기에 있지요. 두 조건부확률을 뒤바꿔 읽는 순간, 숫자는 사실을 왜곡하는 도구가 되어 버립니다.

더 근본적인 함정도 있습니다. 경제 글을 읽은 독자의 전환율이 3%, 연예 글을 읽은 독자의 전환율이 0.5%라 해도, 경제 글이 구독의 원인이라고 단정할 수는 없습니다. 원래 유료 뉴스에 관심이 많은 사람이 경제 글을 즐겨 읽었을 수도 있으니까요. 상관관계는 인과관계가 아닙니다. 조건부확률은 ‘어떤 조건에서 사건이 얼마나 자주 일어났는가’를 보여 줄 뿐, 그 조건이 사건을 일으켰다는 것까지 증명하지는 않습니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
독자 다섯 명의 체류 시간이 30, 40, 50, 60, 420초였다고 합시다. 평균은 120초이지만, 다섯 중 넷은 1분도 머물지 않았습니다. 한 명의 큰 값(420초)이 평균을 크게 끌어올린 탓이지요. 이럴 때는 중앙값(50초)이 ‘전형적인 독자’를 훨씬 잘 대표합니다.

게다가 체류 시간이 길다고 반드시 열심히 읽은 것도 아닙니다. 페이지를 열어 둔 채 딴 일을 했을 수도 있고, 짧은 글이라면 40초 만에 다 읽었을 수도 있으니까요. 그래서 평균 하나로 만족도를 판단해서는 안 되고, 중앙값, 분포, 이상치, 글의 길이를 함께 봐야 합니다. 숫자는 정확히 계산되지만, 그 의미는 맥락이 정합니다.

언론사는 여러 지표를 하나의 점수로 합치기도 합니다. 조회 수 점수를 V, 체류 시간을 T, 완독률을 C, 공유・저장을 H, 구독 전환을 R이라 하고, 각 지표를 0과 1 사이의 값으로 환산한 뒤 중요도만큼 가중치를 곱해 더하는 것이지요.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
가중치를 모두 더하면 1이 되므로, 이 점수 S역시 0과 1 사이의 값을 갖는 가중평균입니다. 위 식은 구독 전환(R)에 0.35를 주어 가장 무겁게 보고 있지요. 가령 어떤 글의 지표가
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
이라 하면
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
가 나옵니다.

그런데 가중치는 자연법칙이 아닙니다. 조회 수의 비중을 키우면 대중적인 글이, 구독 전환의 비중을 키우면 전문적인 글이 유리해집니다. 공유율을 크게 반영하면 분노를 부른 글이 높은 점수를 받을 수도 있지요. 가중치는 곧 언론사의 우선순위를 숫자로 옮긴 것입니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
같은 글에 두 제목을 붙여 반응을 견주는 A/B 테스트를 해봅시다.
제목 클릭률 완독률 구독 전환율
A 12% 72% 2.8%
B 17% 21% 0.4%

제목 B는 클릭률이 높지만 완독률과 전환율은 낮습니다. 자극적인 제목으로 관심은 끌었으나 본문이 기대와 달랐던 것이지요. 반대로 제목 A는 클릭이 적어도 진짜 관심 있는 독자를 데려왔습니다. 클릭을 많이 부른 제목과 독자의 신뢰를 얻은 제목은 다를 수 있습니다. A/B 테스트의 승자 역시 어떤 지표를 기준으로 삼느냐에 따라 뒤바뀝니다.

확률과 통계의 통계 단원은 모집단 전체를 조사하는 대신 표본을 추출하여 모집단을 추정하는 법을 다룹니다. 그래서 표본이 모집단을 잘 대표하는지가 늘 관건이지요. 디지털 플랫폼은 수십만 명의 자료를 모을 수 있지만, 유료 구독자만 분석하면 비용 때문에 구독하지 못한 사람이 빠지고, 앱 이용자만 보면 웹이나 종이로 읽는 사람이 제외됩니다.

특히 조심할 것은 조용히 떠난 사람들입니다. 어떤 글이 실망스러워 다시 찾지 않은 독자는 그 뒤로 아무 기록도 남기지 않습니다. 남은 것은 계속 방문하는 사람들의 자료뿐이라, 이것만 보면 “독자는 대체로 만족한다”는 결론이 나오기 쉽지요. 정작 떠난 사람들의 불만은 어디에도 남아 있지 않기 때문입니다.

편향된 백만 명의 자료가, 잘 설계된 천 명의 표본보다 반드시 낫지는 않습니다. 선거 여론조사에서 ‘표본을 어떻게 뽑았는가’를 그토록 따지는 것도 같은 이유에서지요.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
조회 수와 완독률, 체류 시간과 구독 전환율은 독자를 이해하는 유용한 자료입니다. 그러나 어느 하나도 독자의 마음을 온전히 보여 주지는 못합니다. 많이 클릭된 글과 오래 읽힌 글, 돈을 내게 한 글과 시민에게 정말 필요한 글은 서로 다를 수 있으니까요.

그러므로 숫자는 "독자가 무엇을 원하는가"에 대한 최종 답이 아니라, 더 나은 질문을 던지기 위한 출발점이어야 합니다. 부수를 읽던 편집자의 눈이 사라진 것이 아니라, 이제 확률과 통계라는 언어로 다시 필요해진 것이지요.

다음 편에서는 이 행동 자료가 인공지능 안에서 어떻게 벡터와 행렬로 바뀌어, 나에게 딱 맞는 추천으로 이어지는지 살펴보겠습니다.

※ 기억할 포인트
조회 수와 완독률 같은 데이터는 독자의 행동을 보여 주지만, 독자의 마음까지 온전히 설명하지는 못합니다. 수학은 데이터의 의미와 한계를 정확히 판단하게 합니다. 통계적 사고는 숫자에 휘둘리지 않고 더 나은 질문을 던지는 힘입니다.
알고리즘 미디어 시대를 읽는 고교 수학의 눈(2)
홍창섭 경희여고 교사