AI 트렌드·관점 · 2026-09-22 · KNOWVERSE

말하지 않는 AI가 가장 빨리 팔렸다 — AI의 다음 승부는 채점에서 납니다

문장을 한 줄도 쓰지 못하는 AI가 요즘 가장 빨리 팔리고 있습니다.

지난 9월 15일, 오픈AI에서 ChatGPT의 RLHF 개발에 참여했던 디오고 알메이다가 세운 타입세이프 AI(TypeSafe AI)가 2년간의 스텔스를 끝내고 '제브(Jev)'라는 모델을 공개했습니다. 4,000만 달러 시드 투자와 함께요. 사흘 뒤 버셀(Vercel)은 제브가 자사 AI 게이트웨이 역사상 가장 빠르게 채택된 모델이라고 밝혔고, 대기자 명단은 닷새 만에 풀렸습니다. 지난주 AI 커뮤니티는 온통 이 얘기였죠.

빠르게 판단하는 인물, 미로 앞에서 오래 생각하는 인물, 채점표를 든 인물이 하나의 구조로 연결된 파울 클레풍 삽화

근데 이 모델, 말을 안 합니다. 질문을 던지면 문장 대신 숫자를 돌려줍니다. "이 고객 문의가 환불 요청인가?"라고 물으면 "네, 환불 요청으로 보입니다"라고 쓰는 게 아니라 0.93이라는 확률을 줍니다. 마침 요즘 읽던 논문 몇 편과 겹쳐 보니, AI가 지금 어디에 와 있고 어디로 가는지가 조금 선명해지더군요.

1. 쓰기와 판단을 떼어낸 AI

제브가 받는 질문은 딱 세 종류입니다. 정해진 보기 중 하나 고르기, 정해진 척도로 점수 매기기, 어떤 진술이 참일 확률 답하기. 그게 전부입니다. 대신 빠르고 쌉니다. 응답은 0.07초에서 0.5초, 가격은 입력 100만 토큰당 0.042달러, 출력은 공짜입니다. 글자를 한 자씩 이어 쓰지 않고 답을 한 번에 내놓으니 가능한 일이죠.

회사는 이걸 '시스템 원(System One) 모델'이라 부릅니다. 대니얼 카너먼이 『생각에 관한 생각』에서 나눈 두 가지 사고, 빠르고 직관적인 시스템 1과 느리고 신중한 시스템 2에서 따온 이름입니다. 제브라는 이름은 경제학자 윌리엄 제번스에서 왔습니다. 효율이 좋아지면 소비가 줄어드는 게 아니라 오히려 늘어난다는 '제번스의 역설'. 판단 한 번이 충분히 싸지면 소프트웨어 곳곳에 판단이 박힐 거라는 베팅이죠.

다만 과장된 부분도 있습니다. 발표 자료의 "193.6배 빠르고 444.6배 싸다"는 가장 느리고 비싼 모델과 비교한 숫자입니다. 비슷한 정확도의 모델과 견주면 25배 빠르고 76배 싼 수준이라는 분석이 나왔고, 자체 평가 정확도도 최상위 LLM보다 6%포인트쯤 낮습니다. '환각이 없다'는 말도 정해진 보기 밖의 답을 지어내지 못한다는 뜻이지, 틀린 보기를 고르지 않는다는 뜻은 아닙니다.

그래도 저는 속도나 가격보다 다른 데 눈이 갔습니다. 30년 가까이 기업 시스템을 설계하면서 보니, 현장 업무의 상당 부분은 사실 '글쓰기'가 아니라 '판단'이거든요. 이 결재를 올릴까 말까, 이 거래는 이상한가, 이 문의는 어느 부서로 보낼까. 지금까지 우리는 이런 판단 하나를 얻으려고 거대한 LLM에게 문단을 쓰게 하고, 그 문단에서 다시 '예/아니오'를 골라내 왔습니다. 계산기로 할 일을 소설가에게 맡겨온 셈이죠. 제브는 그 둘을 떼어냈습니다.

2. 논문이 가리키는 곳: 잘 쓴 답안보다 믿을 만한 채점

제브 소식을 보면서 최근 읽은 논문 네 편이 자연스럽게 겹쳐졌습니다. 공교롭게도 전부 같은 곳을 가리키고 있더군요.

첫 번째는 마이크로소프트 리서치 아시아의 rStar-Math입니다. 70억 파라미터짜리 작은 모델로 오픈AI o1 수준의 수학 추론을 해냈다는 논문이죠. MATH 벤치마크 정답률을 58.8%에서 90.0%로 끌어올렸고, 미국 수학 올림피아드 예선인 AIME 문제도 평균 53.3%를 풀었습니다. 방법은 카너먼식으로 말하면 '시스템 2', 즉 여러 갈래로 천천히 풀어보고 좋은 길을 골라가는 방식입니다.

제 눈에 들어온 건 결과 분석의 한 대목이었습니다. 이런 깊은 추론에서 성능을 좌우하는 결정적 요소는 답을 쓰는 모델이 아니라 풀이 단계를 채점하는 '보상 모델'이라는 겁니다. 실제로 7B 모델에 잘 만든 7B 채점 모델을 붙이자, 72B 모델에 72B 채점 모델을 붙인 조합을 이겼습니다. 크기가 제각각인 모델들도 채점 모델을 붙이고 나니 성능이 비슷한 수준으로 모였고요. 답안지를 쓰는 학생보다 채점하는 선생님이 더 중요했다는 얘기입니다.

더 흥미로운 대목도 있습니다. 스스로 틀렸다는 걸 알아차리고 되돌아가 다른 풀이를 찾는 '자기 성찰'이 나타났는데, 그걸 가르치는 데이터를 넣은 적이 없다는 겁니다. 좋은 채점이 반복되자 반성하는 습관이 저절로 생긴 거죠.

두 번째는 홍콩대·UC버클리·구글 딥마인드 연구진의 논문인데, 제목이 모든 걸 말해줍니다. "SFT는 암기하고, RL은 일반화한다." 정답 예시를 보여주며 따라 하게 하는 학습(SFT)은 배운 규칙을 외울 뿐, 조건이 조금만 바뀌어도 무너졌습니다. 반면 결과가 맞았는지만 채점해 주는 강화학습(RL)은 처음 보는 규칙과 화면에도 통하는 원리를 익혔습니다. 검증을 여러 번 거칠수록 일반화가 더 좋아졌다는 결과도 있고요. 그렇다고 SFT가 쓸모없는 건 아닙니다. 답의 형식을 먼저 잡아줘야 RL이 제 역할을 한다고 논문은 덧붙입니다.

이 논문을 읽으면서 신입사원 교육이 떠올랐습니다. 매뉴얼만 외운 신입은 매뉴얼에 없는 상황에서 멈춥니다. 결과로 피드백을 받아본 신입은 처음 보는 상황에서도 원리를 찾아가죠. 사람이든 AI든, 결국 '무엇이 맞는지' 알려주는 기준이 있어야 성장합니다.

세 번째는 홍콩대와 세일즈포스의 AGUVIS입니다. 사람처럼 화면을 눈으로 보고 클릭하고 타이핑하는 에이전트죠. 웹페이지 코드를 통째로 읽는 대신 화면 이미지만 보니, GPT-4o 대비 한 단계에 들어가는 입력 토큰은 70%, 비용은 93% 줄었습니다. 그런데 이 논문의 백미는 오히려 스스로 밝힌 약점입니다. 틀린 사례를 뜯어보니 40%가 지시 자체가 모호한 경우였는데, 모델에겐 "확실하지 않다"고 말하거나 실행을 거부할 능력이 없었다는 겁니다. 연구진은 언제 깊게 생각하고 언제 바로 실행할지 정하는 '동적 기준'이 필요하다고 제안합니다.

어디서 많이 듣던 얘기 아닌가요? 확신이 없을 때 멈추는 능력, 쉬운 일과 어려운 일을 가려내는 능력. 정확히 제브가 팔겠다고 나선 기능입니다. 요청의 난이도를 보고 작은 모델과 큰 모델에 나눠 보내는 라우팅, 도구를 실행하기 직전의 위험 판단, 그리고 확신도 점수. 논문이 빠진 부품이라고 적어둔 자리에 제품이 들어가고 있는 셈이죠.

네 번째는 지난 9월 20일 개정판이 올라온 서베이, 「LLM을 위한 에이전틱 추론」입니다. 일리노이대를 중심으로 메타·아마존·구글 딥마인드 연구자들이 함께 썼습니다. 이들은 지금의 흐름을 이렇게 정리합니다. LLM이 문장을 '생성'하는 존재에서, 계획하고 행동하고 경험으로 배우는 '에이전트'로 다시 정의되고 있다고요. 남은 숙제로는 긴 작업에서 어떤 행동이 성과에 기여했는지 가려내는 문제, 세계 모델, 그리고 거버넌스를 꼽습니다. 특히 말로 드러내지 않고 내부에서만 추론하는 방식은 효율적이지만 감사(audit)하기 어렵다는 경고가 눈에 띕니다. 말하지 않는 AI가 늘어날수록, 그 판단을 누가 어떻게 검증할지가 더 중요해진다는 뜻이니까요.

3. AI는 지금 어디에 와 있나

지난 2년, AI 업계의 경쟁은 누가 더 길고 깊게 생각하느냐였습니다. o1 이후의 추론 모델 경쟁이 그랬죠. 카너먼의 말로 하면 시스템 2를 키우는 경쟁이었습니다. 그리고 그 경쟁은 이제 상당히 무르익었습니다. 70억 파라미터짜리 모델이 올림피아드 예선 문제를 절반 넘게 푸는 시대니까요.

그런데 위 논문들을 나란히 놓고 보면 공통된 발견이 하나 있습니다. 생각을 깊게 하는 것만으로는 부족하고, 그 생각이 옳은지 가려내는 '판단'이 성능을 좌우한다는 점입니다. rStar-Math에서는 채점 모델이, SFT와 RL을 비교한 논문에서는 결과 채점이, AGUVIS에서는 멈출 줄 아는 능력이 핵심 요소였습니다.

저는 지금 AI가 서 있는 자리를 이렇게 봅니다. 생성의 시대는 정점을 지났고, 판단의 시대가 막 시작됐다. 제브는 그 신호 중 하나입니다.

4. 앞으로 AI는 어디로 가는가

이 흐름을 조금 더 밀고 나가 보면, 앞으로의 AI는 하나의 거대한 천재 모델이 아니라 역할이 나뉜 '조직'에 가까워질 거라고 저는 봅니다.

빠르게 가르고 거르는 시스템 1, 어려운 문제를 붙잡고 오래 생각하는 시스템 2, 그리고 그 결과를 채점하는 검증자. 쉬운 건 0.1초 만에 처리하고, 애매하면 멈추고, 어려우면 큰 모델을 부르고, 결과는 다시 채점받는 구조입니다. 에이전틱 추론 서베이가 그리는 관리자·작업자·비평가의 역할 분담도 결국 같은 그림이죠. 사람의 조직이 그렇게 돌아가듯, AI도 그렇게 조립될 겁니다.

그 구조에서 가장 비싸지는 건 모델이 아니라 '채점표'입니다. 무엇이 좋은 답인지, 어떤 판단이 맞는지를 정의하는 기준 말이죠. 수학은 정답이 있어서 채점이 쉽습니다. 코드는 테스트를 돌려보면 됩니다. rStar-Math 연구진도 다른 분야로 넓히려면 결과가 맞았는지 알려줄 장치가 필요하다고 적었습니다. 그런데 기업의 일은 어떤가요? 이 대출을 승인하는 게 맞는지, 이 고객 응대가 좋았는지, 이 설계가 옳은지. 그 정답이 문서로 적혀 있는 회사가 얼마나 될까요?

저는 이걸 '채점표 경쟁력'이라고 부르고 싶습니다. 모델은 누구나 사서 쓸 수 있습니다. 판단 한 번에 0.0004달러 수준이라면 더더욱 그렇죠. 하지만 우리 회사가 무엇을 '맞다'고 보는지, 그 기준은 누구도 대신 만들어주지 않습니다. 앞으로 AI 도입의 성패는 어떤 모델을 쓰느냐보다, 우리 조직의 판단 기준을 AI가 알아들을 수 있는 형태로 꺼내놓을 수 있느냐에서 갈릴 겁니다.

하나 더 있습니다. 판단이 싸질수록 판단의 양은 폭발적으로 늘어납니다. 제번스가 160년 전 석탄으로 보여준 그 역설이죠. 하루 수십 번 하던 판단을 AI가 수백만 번 하게 되면, 그 판단이 틀렸을 때 누가 알아차리고 누가 책임질지가 곧 경영의 문제가 됩니다. 서베이가 거버넌스를 마지막 숙제로 꼽은 것도 같은 맥락일 겁니다.

AI는 이제 말을 잘하는 단계를 지나, 판단을 잘하는 단계로 가고 있습니다.
그리고 판단의 품질은 결국 채점의 품질입니다.

모델은 살 수 있어도,
기준은 살 수 없습니다.

AX의 핵심은 결국 AI에이전트가 참고할 기준을 만드는 것입니다.
그 기준을 어떻게 만들지, 이후 운영은 어떻게 해나갈지 고민이신 분은 편하게 문의 주세요.

노우버스가 함께 합니다.

← 인사이트 목록으로