기술 신호2026-09-29

작업당 출력 49.3K에서 29.9K로

Fireworks가 Kimi K3의 토큰을 40% 덜 쓰게 다시 훈련했다

Fireworks가 Kimi K3를 추가 훈련한 Ember-1을 연구 프리뷰로 냈다. 실사용 A/B 테스트에서 출력 토큰이 작업당 49.3K에서 29.9K로 줄었고 품질 점수는 0.753 대 0.751로 같았다. 단가는 그대로여서 청구서가 토큰만큼 준다.

에이전트가 일 하나를 끝낼 때 뱉는 출력이 49.3K 토큰이었다. Fireworks Research가 Kimi K3를 추가 훈련한 Ember-1은 같은 일을 29.9K 토큰으로 끝냈다. 실사용 A/B 테스트에서 품질 점수는 0.753과 0.751로 사실상 같았다. 9월 28일 공개된 연구 프리뷰이고 HN 프런트에도 올라 250점 넘게 받았다.

한 줄 정리

Fireworks가 Kimi K3를 추가 훈련해 품질은 유지한 채 토큰 사용량을 약 40% 줄였고, 단가가 같아서 에이전트 작업의 청구서가 그만큼 내려간다.

한눈에 보기

항목 Kimi K3 Ember-1
작업당 출력 토큰 (A/B 테스트) 49.3K 29.9K
품질 점수 0.751 0.753
입력 단가 (100만 토큰당) $3.00 $3.00
캐시 입력 $0.30 $0.30
출력 단가 (100만 토큰당) $15.00 $15.00
Terminal Bench 2.1 80.9% 82.0%
DeepSWE 1.1 66.4% 75.2%
SWE-bench Verified 93.2% 92.2%

벤치마크 비교 대상은 K3 Max 기준이다. 두 모델은 Fireworks 서버리스에서 같은 가격표를 쓴다.

추론 강도를 낮추는 것과 다르다

토큰을 아끼는 손쉬운 방법은 추론 강도를 낮추는 것이다. 그러면 답이 짧아지지만 오류를 스스로 바로잡는 재검토까지 같이 사라져 품질이 떨어진다. Fireworks는 이 방식을 쓰지 않았다고 밝혔다. 오류를 고치는 재검토는 남기고 쓸데없는 되풀이와 곁가지 추론만 덜어내도록 후속 훈련을 했다. 훈련 실험은 50회 이상, 평가는 200회 이상 돌렸다.

절감 폭은 지표마다 다르다. 추론 토큰만 보면 35~50% 줄었고 한 고객 테스트에서는 71.3%까지 내려갔다. 다만 답변 본문까지 합친 전체 토큰은 39% 감소에 그쳤다. 고객 두 곳의 라이브 A/B에서는 작업당 약 35% 감소가 나왔다. 발표 문구는 40%지만 각자의 워크로드는 35~39% 근처로 잡는 편이 안전하다.

청구서로 옮겨 보면

출력 100만 토큰에 15달러를 기준으로 계산하면 작업 하나당 출력 비용은 약 $0.74에서 $0.45로 내려간다. 하루에 에이전트 작업 1,000건을 돌리는 팀이면 출력 비용만 약 $740에서 $450이다. 입력 비용은 별도이고 이 계산에 넣지 않았다.

빠져 있는 것도 있다. 모델 가중치와 훈련 코드는 공개되지 않았고 Fireworks 서버리스 API에서만 쓸 수 있다. 연구 프리뷰라서 안정 버전이 아니다. 품질 우위도 일부 벤치마크에서만 나온다. SWE-bench Verified와 SWE-Interact는 원본 K3 Max가 근소하게 앞선다.

anyAX 관점

가격표가 같은데 청구서가 다르다는 점이 이 뉴스의 핵심이다. 지난 1년 동안 모델을 고르는 기준은 100만 토큰당 단가였다. Ember-1은 그 기준이 반쪽이라는 걸 보여 준다. 작업당 토큰이 절반 가까이 달라지면 단가 비교표의 순서가 뒤집힐 수 있다.

리서치 에이전트나 카피 초안 자동화를 돌리는 작은 에이전시라면 확인할 항목은 단가가 아니라 작업당 총비용이다. 같은 업무 스무 건을 두 모델에 던져 토큰 수와 결과물을 나란히 놓는 데 반나절이면 충분하다. 그 실험 없이 갈아타면 싼 모델이 오히려 비싸다는 결과가 나올 수 있다.

한편 가중치가 닫혀 있다는 점은 의존 리스크다. 이번에 아낀 40%는 Fireworks 한 곳의 서버리스에 묶여 있고 프리뷰가 끝난 뒤의 가격과 유지 여부는 아직 모른다. 워크플로 전체를 여기에 박기보다 자주 도는 분류와 요약 단계부터 시험하는 쪽이 맞다.

참고