조회 수는 독자의 마음을 알고 있을까
- 확률과 통계로 읽는 숫자의 이면
- 확률과 통계로 읽는 숫자의 이면
디지털 언론은 독자의 행동을 숫자로 바꿉니다. 조회 수, 체류 시간, 완독률, 재방문율, 구독 전환율이 거의 실시간으로 집계되지요. 숫자는 분명합니다. 10만 회는 2만 회보다 크고, 완독률 70%는 20%보다 높습니다. 그러나 계산이 명확하다고 해석까지 명확한 것은 아닙니다. 이 숫자들을 어떻게 읽어야 하는지, 여러분이 배우는 확률과 통계의 눈으로 따져 봅시다.
지표마다 보여 주는 것이 다릅니다. 조회 수는 글이 얼마나 많은 사람에게 도달했는지를, 완독률은 그중 얼마나 깊이 읽혔는지를, 구독 전환율은 돈을 낼 만큼 가치를 느꼈을 가능성을 나타냅니다. 이를테면 어떤 글을 1만명이 열어 7000명이 끝까지 읽었다면 완독률은 70%, 그 가운데 150명이 구독했다면 전환율은 1.5%이지요. 조회 수가 규모를 말한다면, 완독률과 전환율은 행동의 강도를 말하는 셈입니다.
두 글을 비교해 봅시다.
| 글 | 조회수 | 완독률 | 구독 전환율 |
| 글A | 100,000회 | 18% | 0.2% |
| 글B | 20,000회 | 76% | 3.5% |
글 A는 B보다 다섯 배 많이 읽혔습니다. 광고 노출이 목표라면 A가 성공작이겠지요. 그러나 B를 읽은 독자는 훨씬 높은 비율로 끝까지 읽었고 유료 구독으로도 이어졌습니다. 충성 독자 확보가 목표라면 B가 더 값집니다. 성공의 기준을 무엇으로 잡느냐에 따라 성공한 글이 달라지는 것입니다.
글 A를 읽은 사건을 A, 유료 구독을 시작한 사건을 S라 하면
여기서 조심할 것이 있습니다.
더 근본적인 함정도 있습니다. 경제 글을 읽은 독자의 전환율이 3%, 연예 글을 읽은 독자의 전환율이 0.5%라 해도, 경제 글이 구독의 원인이라고 단정할 수는 없습니다. 원래 유료 뉴스에 관심이 많은 사람이 경제 글을 즐겨 읽었을 수도 있으니까요. 상관관계는 인과관계가 아닙니다. 조건부확률은 ‘어떤 조건에서 사건이 얼마나 자주 일어났는가’를 보여 줄 뿐, 그 조건이 사건을 일으켰다는 것까지 증명하지는 않습니다.
게다가 체류 시간이 길다고 반드시 열심히 읽은 것도 아닙니다. 페이지를 열어 둔 채 딴 일을 했을 수도 있고, 짧은 글이라면 40초 만에 다 읽었을 수도 있으니까요. 그래서 평균 하나로 만족도를 판단해서는 안 되고, 중앙값, 분포, 이상치, 글의 길이를 함께 봐야 합니다. 숫자는 정확히 계산되지만, 그 의미는 맥락이 정합니다.
언론사는 여러 지표를 하나의 점수로 합치기도 합니다. 조회 수 점수를 V, 체류 시간을 T, 완독률을 C, 공유・저장을 H, 구독 전환을 R이라 하고, 각 지표를 0과 1 사이의 값으로 환산한 뒤 중요도만큼 가중치를 곱해 더하는 것이지요.
그런데 가중치는 자연법칙이 아닙니다. 조회 수의 비중을 키우면 대중적인 글이, 구독 전환의 비중을 키우면 전문적인 글이 유리해집니다. 공유율을 크게 반영하면 분노를 부른 글이 높은 점수를 받을 수도 있지요. 가중치는 곧 언론사의 우선순위를 숫자로 옮긴 것입니다.
| 제목 | 클릭률 | 완독률 | 구독 전환율 |
| A | 12% | 72% | 2.8% |
| B | 17% | 21% | 0.4% |
제목 B는 클릭률이 높지만 완독률과 전환율은 낮습니다. 자극적인 제목으로 관심은 끌었으나 본문이 기대와 달랐던 것이지요. 반대로 제목 A는 클릭이 적어도 진짜 관심 있는 독자를 데려왔습니다. 클릭을 많이 부른 제목과 독자의 신뢰를 얻은 제목은 다를 수 있습니다. A/B 테스트의 승자 역시 어떤 지표를 기준으로 삼느냐에 따라 뒤바뀝니다.
확률과 통계의 통계 단원은 모집단 전체를 조사하는 대신 표본을 추출하여 모집단을 추정하는 법을 다룹니다. 그래서 표본이 모집단을 잘 대표하는지가 늘 관건이지요. 디지털 플랫폼은 수십만 명의 자료를 모을 수 있지만, 유료 구독자만 분석하면 비용 때문에 구독하지 못한 사람이 빠지고, 앱 이용자만 보면 웹이나 종이로 읽는 사람이 제외됩니다.
특히 조심할 것은 조용히 떠난 사람들입니다. 어떤 글이 실망스러워 다시 찾지 않은 독자는 그 뒤로 아무 기록도 남기지 않습니다. 남은 것은 계속 방문하는 사람들의 자료뿐이라, 이것만 보면 “독자는 대체로 만족한다”는 결론이 나오기 쉽지요. 정작 떠난 사람들의 불만은 어디에도 남아 있지 않기 때문입니다.
편향된 백만 명의 자료가, 잘 설계된 천 명의 표본보다 반드시 낫지는 않습니다. 선거 여론조사에서 ‘표본을 어떻게 뽑았는가’를 그토록 따지는 것도 같은 이유에서지요.
그러므로 숫자는 "독자가 무엇을 원하는가"에 대한 최종 답이 아니라, 더 나은 질문을 던지기 위한 출발점이어야 합니다. 부수를 읽던 편집자의 눈이 사라진 것이 아니라, 이제 확률과 통계라는 언어로 다시 필요해진 것이지요.
다음 편에서는 이 행동 자료가 인공지능 안에서 어떻게 벡터와 행렬로 바뀌어, 나에게 딱 맞는 추천으로 이어지는지 살펴보겠습니다.
※ 기억할 포인트
조회 수와 완독률 같은 데이터는 독자의 행동을 보여 주지만, 독자의 마음까지 온전히 설명하지는 못합니다. 수학은 데이터의 의미와 한계를 정확히 판단하게 합니다. 통계적 사고는 숫자에 휘둘리지 않고 더 나은 질문을 던지는 힘입니다.


