쿼리 8,400개 벤치마크에서 2위
KT 오토모델라우터가 라우팅 경쟁에 올라탔다
라이스대학교의 LLM 라우터 벤치마크 RouterArena에서 KT 오토모델라우터가 2위에 올랐다. 쿼리 8,400건을 정확도와 비용으로 함께 평가한 결과다. KT는 이 기술을 토큰 팩토리에 얹어 기업 고객의 AI 비용을 낮추는 데 쓴다.
라이스대학교가 만든 LLM 라우터 평가 플랫폼 RouterArena는 쿼리 8,400건으로 라우터의 정확도와 비용을 함께 잰다. 이 벤치마크는 ICLR 2026 논문으로 채택됐고 23개 라우터를 순위표에 올려 뒀다. 1위 vLLM-SR은 정확도 77.18퍼센트에 쿼리 1천 건당 0.30달러라는 비용을 기록하며 Acc-Cost Arena 점수 75.30을 받았다. KT의 오토모델라우터는 9월 27일 이 부문 2위에 올랐다고 발표됐다.
한 줄 정리
쿼리 8,400건짜리 국제 벤치마크에서 KT 오토모델라우터가 2위에 오르며 모델 라우팅이 국내 통신사의 자체 기술로 검증됐다.
한눈에 보기
| 벤치마크 | RouterArena, Acc-Cost Arena 부문 |
| 개발 | 라이스대학교, ICLR 2026 논문 채택 |
| 평가 규모 | 쿼리 8,400건, 총 23개 라우터 순위 |
| 1위 | vLLM-SR (정확도 77.18%, 쿼리 1천 건당 0.30달러, 점수 75.30) |
| KT 순위 | 오토모델라우터 2위 (9월 27일 발표) |
| 적용처 | KT 토큰 팩토리 등 에이전틱 AI 서비스 |
무엇을 고르는 기술인가
오토모델라우터는 요청이 들어오면 작업 종류와 난이도, 지식 도메인부터 나눈다. 그 다음 응답 품질과 사용 비용을 함께 놓고 어떤 모델에 보낼지 정하는데 이때 기준은 가장 비싼 모델도 가장 싼 모델도 아니다. 어려운 작업은 성능이 좋은 모델로, 쉬운 분류나 요약 작업은 저렴한 모델로 자동으로 갈라 보낸다는 뜻이다. 예를 들어 고객 문의를 카테고리별로 나누는 일과 계약서 문구를 검토하는 일은 요구하는 정확도 수준이 다른데 지금까지는 개발자가 이 둘에 어떤 모델을 쓸지 코드에 미리 정해 넣었다. 콘텐츠 마케팅 팀이 쓰는 도구로 바꿔 말하면, 짧은 SNS 캡션을 뽑는 일과 브랜드 톤을 지켜야 하는 긴 카피를 쓰는 일에 같은 모델을 쓸 이유가 없다는 뜻이다. 라우터는 이 결정을 요청이 들어올 때마다 새로 내린다. KT는 이 기술을 토큰 팩토리라는 플랫폼에 얹어 여러 모델과 토큰 사용량을 한 화면에서 관리한다.
왜 KT가 이 경쟁에 뛰어들었나
KT의 에이전틱 AI랩을 이끄는 김준석 상무는 오토모델라우터가 KT의 에이전틱 AI 서비스 경쟁력을 뒷받침하는 핵심 기술이 될 거라고 밝혔다. 기업 고객을 상대하는 통신사 입장에서 라우팅 기술은 서비스 품질과 운영 비용을 동시에 잡아야 하는 AX 사업의 뼈대다. 국제 벤치마크 2위라는 결과는 이 기술을 외부에 파는 근거로 쓰기에 충분한 숫자다. 통신사가 이런 벤치마크에 참가해 순위를 공개적으로 받는다는 사실 자체도 눈여겨볼 지점이다. 예전 같으면 자체 기술을 보도자료 속 주장으로만 남겼겠지만 이제는 라이스대학교가 굴리는 외부 리더보드에 이름을 올려 검증받는 쪽을 택했다.
라우팅과 사람의 판단은 어떻게 다른가
지금 대부분의 소규모 팀과 1인 SaaS 개발자는 기능 하나에 모델 하나를 고정해 붙인다. 처음 붙일 때 성능과 비용을 비교해 보고 한 번 정하면 그 뒤로는 잘 안 바꾼다. 사용량이 늘어도, 더 싼 모델이 새로 나와도 코드를 다시 열어 고치기 전에는 그대로 간다. 라우터는 이 판단을 요청 단위로 반복한다. 신규 모델이 나오면 라우팅 정책만 갱신해서 전체 서비스에 바로 반영할 수 있다는 뜻이다. RouterArena가 비공개 평가가 아니라 누구나 확인할 수 있는 라이브 리더보드로 운영된다는 점도 함께 봐야 한다. 23개 라우터의 순위와 쿼리 8,400건짜리 데이터셋, 채점 방식이 모두 열려 있어서 소규모 팀이 AI 벤더의 라우팅 성능 주장을 들을 때 이제는 마케팅 문구만 믿을 필요가 없다. 같은 잣대로 매겨진 점수를 직접 찾아볼 수 있다.
라우팅 경쟁이 왜 지금 통신사로 넘어왔나
국내 기업용 AI 시장은 네이버클라우드, SKT, LG 계열, 그리고 KT가 각자 에이전틱 AI 플랫폼을 내놓고 기업 고객을 두고 경쟁하는 구도다. 이 경쟁에서 모델 자체를 만드는 능력보다 여러 모델을 섞어 쓰면서 비용과 품질을 동시에 관리하는 능력이 실제 계약을 좌우하는 경우가 늘고 있다. 오토모델라우터가 국제 벤치마크에서 받은 2위는 KT가 이 경쟁에서 내세울 수 있는 검증된 숫자 하나를 확보했다는 뜻이다. 기업 고객 입장에서는 라우팅 기술의 성능을 벤더의 말이 아니라 RouterArena 같은 외부 리더보드로 직접 확인하고 계약을 검토할 수 있는 여지가 생겼다는 것도 함께 봐야 할 변화다.
아직 확인되지 않은 부분
이번 발표에는 빈틈도 있다. KT는 오토모델라우터가 실제로 비용을 몇 퍼센트 줄이는지, 어떤 모델들 사이에서 라우팅이 일어나는지 구체적인 수치를 공개하지 않았다. RouterArena의 공개 리더보드에서도 이번 확인 시점에는 KT의 이름이 직접 보이지 않았고 국내 언론 보도만으로 순위를 확인해야 했다. 또한 이 기술이 KT의 일반 기업 고객 누구나 바로 쓸 수 있는 형태인지, 아니면 대형 계약을 맺은 일부 고객에게만 먼저 열리는지도 아직 분명하지 않다. 작은 팀이 당장 이 라우팅 기술 자체를 가져다 쓸 수 있는 건 아니라는 점은 분명히 해 둘 필요가 있다. 다만 이런 벤치마크가 계속 쌓이면 오픈소스로 공개된 라우팅 방법론을 참고해서 직접 간단한 라우팅 로직을 짜 보는 팀도 늘어날 가능성이 크다. RouterArena 자체가 오픈 플랫폼을 지향한다는 점을 보면 이 기술의 문턱이 지금보다는 낮아지는 방향으로 갈 공산이 크다. 지금 당장 할 수 있는 일은 자기 팀이 매 작업마다 실제로 어떤 모델을 쓰고 있는지, 그 선택이 여전히 최선인지를 한 번 되짚어 보는 정도다. 처음 모델을 고를 때의 가격과 성능 조건은 몇 달 사이 대부분 바뀌어 있다.
anyAX 관점
팀 하나가 요청마다 가장 비싼 모델을 쓰면 청구서 자릿수가 바로 올라간다. 쿼리 8,400건짜리 잣대로 2위를 받은 라우팅 기술은 그 청구서를 정확도를 깎지 않고 낮춘다. 오토모델라우터가 하는 일은 사람이 매번 하던 판단, 이 작업엔 어떤 모델이 맞을까를 자동화한 것뿐인데 콘텐츠와 마케팅을 맡은 소규모 팀 대부분은 아직 이 판단을 사람이 손으로 한다. Claude냐 GPT냐를 매번 고민하는 시간 자체가 라우팅 기술 하나의 값이다.