본문으로 건너뛰기
기술 소식을 빠르게 전달드립니다
HYUKHO

AI

Muse Spark 1.3 출시 총정리: xhigh·max 성능과 가격, 한계

Muse Spark 1.3은 코딩·도구 사용·장기 에이전트 작업을 강화한 멀티모달 추론 모델입니다. 공개 설정인 xhigh의 성능, 평가상 한계, 가격과 도입 전 확인 사항을 정리했습니다.

· · 5 · AI

Muse Spark 1.3은 코딩, 도구 사용, 장시간 에이전트 작업을 강화한 멀티모달 추론 모델입니다. 공개 버전인 xhigh는 이전 모델보다 주요 에이전트 평가 점수가 높아졌지만, 작업당 비용은 늘었고 장문 추론과 사실 정확도 지표는 일부 낮아졌습니다. 따라서 실제 도입 전에는 벤치마크 순위보다 팀의 업무를 기준으로 성능과 비용을 함께 시험하는 편이 좋습니다.

Muse Spark 1.3은 무엇이 달라졌나

Meta Superintelligence Labs는 2026년 9월 2일 Muse Spark 1.3을 공개했습니다. 이번 업데이트는 범용 챗봇 성능보다 코딩과 도구 연동, 여러 단계가 이어지는 에이전트 작업 개선에 초점을 맞췄습니다. Muse Code와 Meta Model API에서 이용할 수 있습니다. Meta 공식 발표

1.2 대비 변화실무적 의미
여러 작업 흐름 추적긴 대화에서도 병렬로 진행되는 과제의 맥락을 구분합니다.
계획 점검·수정누락된 단계를 발견하면 진행 중인 계획을 보완합니다.
확인 질문 강화지시가 모호하거나 되돌리기 어려운 작업은 사용자에게 먼저 확인합니다.
긴 지시 유지세부 조건과 코드 스타일을 더 안정적으로 따릅니다.
도구 사용 효율화Meta 내부 비교에서 도구 호출은 약 20%, 토큰 사용량은 약 25% 감소했습니다.

도구 호출과 토큰 사용량 감소율은 평가 조건이 공개되지 않은 내부 결과입니다. 이를 실제 서비스 비용이 20~25% 줄어든다는 의미로 해석하기는 어렵습니다.

Muse Spark 1.3 xhigh와 max 성능 비교

일반에 공개된 설정은 xhigh입니다. 일부 지표가 더 높은 max는 파트너 대상 제한 미리보기로 제공되며, 추가 안전성 테스트를 거치고 있습니다. 현재 도입 가능성을 검토한다면 xhigh를 기준으로 판단하는 편이 합리적입니다.

Artificial Analysis의 독립 평가에서는 다음과 같은 결과가 나왔습니다.

지표1.21.3 xhigh1.3 max
Intelligence Index576162
τ³-Bench Banking35%47%52%
GDPval-AA v21,6151,7091,754
Terminal-Bench 2.180%85%86%

max는 에이전트 평가에서 더 많은 추론 토큰과 대화 단계를 사용했습니다. Intelligence Index에서 얻은 1점 차이만으로 max가 언제나 더 효율적이라고 보기는 어렵습니다.

평가 기관에 따른 수치 차이도 살펴봐야 합니다. Meta가 공개한 Terminal-Bench 결과는 xhigh 89.2%, max 88.8%였지만, 독립 평가에서는 각각 85%와 86%를 기록했습니다. 평가 환경과 조건이 다르므로 수치를 평균 내거나 한쪽의 절대적인 우위로 연결해서는 안 됩니다.

코딩·에이전트·멀티모달 성능

Muse Spark 1.3의 두드러진 강점은 에이전트 도구 사용과 과학 추론입니다. GPQA Diamond 점수는 90%에서 94%로 높아졌으며, 전문 CUDA 최적화 평가인 KernelBench에서는 5개 문제 중 4개를 해결했습니다. 다만 KernelBench 결과는 표본이 작아 모델의 전반적인 코딩 능력을 대표한다고 보기는 어렵습니다.

영역확인된 결과해석할 때 주의할 점
장문 추론AA-LCR이 83%에서 79%로 낮아졌습니다.컨텍스트 크기와 장문 추론 정확도는 별개의 지표입니다.
사실 정확도AA-Omniscience 정확도가 45%에서 42%로 하락했습니다.모든 유형의 사실 질의가 개선된 것은 아닙니다.
시각 이해Roboflow 평가에서 OCR 91.3%, 사물 식별 92.7%를 기록했습니다.특정 평가 환경에서 측정된 결과입니다.
객체 탐지·속도객체 탐지 58.6%, 평균 처리 시간은 샘플당 23.14초였습니다.실시간 처리나 대규모 배치 작업에는 별도 검증이 필요합니다.

약 100만 토큰의 컨텍스트를 지원한다는 것은 한 번에 긴 자료를 입력할 수 있다는 뜻입니다. 입력된 전체 내용을 끝까지 정확하게 연결해 추론한다는 보장은 아니에요.

이 글은 출시 이틀 뒤까지 공개된 자료를 기준으로 정리했습니다. 대규모 실제 프로젝트에서의 안정성과 장기 유지보수 품질은 추가 사례를 지켜봐야 합니다.

Muse Spark 1.3 가격과 이용 방법

Muse Spark 1.3은 Muse Code 또는 Meta Model API에서 약 100만 토큰 컨텍스트로 이용할 수 있습니다. 정확한 출력 한도와 지역별 제공 범위는 사용 전에 별도로 확인해야 합니다.

요금제입력 / 캐시 입력 / 출력 100만 토큰조건
Standard$1.25 / $0.15 / $4.25Muse Spark 1.2와 같은 단가입니다.
Contributor$0.10 / $0.002 / $0.20입출력 데이터가 제품 개선에 활용될 수 있습니다.
max미공개파트너 대상 제한 미리보기입니다.

표면적인 토큰 단가는 이전 버전과 같지만, 독립 평가에서 측정한 작업당 비용은 Muse Spark 1.2의 약 $0.40에서 xhigh의 약 $0.55로 늘었습니다. 에이전트 평가에서 입력 토큰 사용량이 증가했기 때문입니다.

따라서 예산을 산정할 때는 토큰 단가표만 비교하지 말고, 실제 업무 한 건을 완료하는 데 필요한 전체 비용을 측정하는 편이 좋습니다. 코드베이스 탐색, 수정, 테스트처럼 동일한 대표 작업을 여러 번 실행하면 비용과 성공률을 함께 비교할 수 있어요.

어떤 팀에 적합한가

Muse Spark 1.3은 장기 코딩 작업과 도구 연동을 API로 실험하려는 팀에 적합합니다. 특히 여러 단계를 계획하고 외부 도구를 호출해야 하는 에이전트 워크플로에서 개선 효과를 확인해 볼 만합니다.

도입 전에는 다음 항목을 점검해야 합니다.

  • 기밀 코드나 고객 데이터를 처리한다면 Contributor 요금제의 데이터 보관·삭제·학습 활용 약관을 먼저 검토합니다.
  • 모델 가중치가 공개되지 않았다는 점과 한국어 성능 자료가 부족하다는 점을 고려합니다.
  • Muse Spark 1.3 전용 안전성 수치와 파일 형식별 제한을 확인합니다.
  • 요청 한도와 동시 실행 한도를 실제 운영 트래픽에 맞춰 점검합니다.
  • 공개 버전인 xhigh로 대표 업무를 시험하고, 성공률·처리 시간·작업당 비용을 함께 기록합니다.

결론적으로 Muse Spark 1.3은 에이전트 작업과 코딩 성능이 개선된 업데이트지만, 모든 평가 영역에서 이전 버전을 앞선 것은 아닙니다. 약 100만 토큰 컨텍스트나 높은 벤치마크 점수만으로 결정하기보다, 실제 업무 기준의 반복 평가를 거쳐 도입 여부를 판단하는 것이 안전합니다.

  1. Gemini 3.8 Flash 출시 총정리: 성능·가격·3.7 차이
  2. Claude Fable 5.1 출시: 주요 특징과 달라진 점 한눈에 보기
  3. OpenClaw 2.0 업데이트 총정리: 달라진 핵심 기능과 업데이트 주의사항

댓글

Giscus를 연결하면 댓글이 열립니다.