싼 토큰과 싼 결과는 다르다.
생성 비용이 90% 줄어도 완료된 결과의 비용은 4.3%만 줄 수 있다. 생산성을 보려면 응답의 가격에서 검토·재작업·완료 기준까지 따라가야 한다.
AI가 답을 빨리 만든다는 것은 생산의 한 단계가 빨라졌다는 뜻이다. 그 답이 사용할 수 있는 결과가 되었는지는 별개의 질문이다. 자본이 사는 것은 텍스트의 양보다 고객이 받아들이고 실제로 작동하는 결과에 가깝다.
한 연구가 알려주는 것과 알려주지 않는 것
METR의 2025년 실험에서는 숙련된 오픈소스 개발자 16명이 자신들의 프로젝트에서 246개 작업을 수행했다. 작업별로 AI 사용 허용 여부를 무작위 배정했고, 해당 조건에서는 AI 허용 시 완료 시간이 19% 길어졌다. 연구진은 이를 모든 개발자나 모든 작업으로 일반화하지 않는다.
우리가 가져갈 질문은 “AI는 느리다”가 아니다. 어떤 작업, 어떤 완료 기준, 어떤 사용자에서 어떤 비용이 바뀌었는가다. 좋은 답을 빠르게 만드는 능력과, 특정 조직의 요구를 만족시키는 결과를 빠르게 만드는 능력을 구분한다.
자료가 바뀌면 판단도 바뀌어야 한다
2026년 2월 METR는 후속 실험의 설계를 바꾸겠다고 설명했다. AI 없이 일하기를 원하지 않는 개발자와 일부 작업이 실험에서 빠지고, 여러 에이전트를 동시에 쓰는 경우 시간 측정도 어려워졌다는 것이다. 연구진은 생산성 향상이 커졌을 가능성을 보면서도 그 크기에 대한 증거는 약하다고 밝혔다.
2025년의 19%를 현재 AI의 고정된 성능으로 쓰면 안 된다. 반대로 후속 자료를 읽고 모두에게 확정된 생산성 배수를 적용해도 안 된다. 서로 다른 시점과 조건을 구분하는 것이 반증을 남기는 방법이다.
생성 다음에 남아 있는 비용
우리의 사고실험에서는 결과 하나의 평균 생성 비용이 0.10달러에서 0.01달러로 줄어든다. 검토·재작업에 각각 2분이 걸리고 시간 비용을 시간당 60달러로 가정하면, 총비용은 2.10달러에서 2.01달러로 줄어든다. 생성 비용은 90% 떨어졌지만 전체 감소는 약 4.3%다. 아래에서 가정을 바꿔볼 수 있다.
이것은 실제 회사의 측정값이나 수익 예측이 아니다. 검토 시간이 함께 줄어들면 효과는 더 커지고, 재작업이 늘어나면 반대로 총비용이 오를 수 있다. 그래서 검토와 재작업은 제거해버릴 부가 항목이 아니라 측정해야 할 생산 단계다.
가치를 만드는 층과 가져가는 층
생성 비용이 내려가도 제품 가격이 경쟁으로 더 빠르게 떨어질 수 있다. 비용 절감이 고객의 낮은 가격, 노동자의 높은 보상, 공급자의 이윤 중 어디에 남는지는 별도로 추적해야 한다. 생산성의 발생과 이익의 귀속은 같은 지표가 아니다.
우리가 제안하는 측정은 검증된 결과당 총비용, 품질 기준을 만족하는 비율, 사람이 쓰는 시간, 재작업과 전달 비용이다. 그 지표가 개선되는지 확인한 뒤에야 어떤 생산 시스템을 소유할 가치가 있는지 논할 수 있다.
응답 하나의 가격에서 멈추지 않는다. 받아들여진 결과 하나의 비용까지 따라간다.
확인한 1차 자료
Kamui의 2026년 9월 19일 글을 실제 생산성 연구와 연결한 분석입니다. 연구 확인일은 2026년 10월 4일입니다. 아래 계산은 선택한 가정의 산술 결과이며, 관측 자료·벤치마크·투자 수익 예측이 아닙니다.