Grok 4.7은 2026년 9월 21일 공개됐다. 코드를 작성하거나 업무 정보를 분석하기 위해 AI를 구매하는 팀이라면 실용적인 질문이 생긴다. 더 나은 모델이 완성된 작업의 비용을 낮춰 주는가? 답은 광고된 토큰 요금만으로 알 수 없다. 공식 출시 노트
이 엇갈린 모습이 Matthew Berman이 9월 22일 공개한 영상의 주제다. Grok 4.7을 어떻게 봐야 할지 모르겠다…그는 비교 대상 선정에 의문을 제기하며 토큰 가격보다 완료된 작업당 비용이 중요하다고 주장한다. 또한 모델을 충분히 시험하지 않았다고 밝힌다. 그의 영상은 증거에 대한 초기 평가이지 종합적인 직접 사용 평가가 아니다. Berman의 소개, 0:00
쓸 만한 모델이 사업의 자동화 비용을 바꾸기 위해 모든 벤치마크에서 이길 필요는 없으므로 출시는 주목할 만하다. 다만 전체 비용을 정당화하려면 충분한 작업을 정확히 끝내야 한다. 독립 시험에서 긴장이 드러난다. Grok 4.7의 더 나은 결과에는 훨씬 많은 생성량이 따를 수 있다.
개발자와 소기업, 에이전트를 만드는 팀에 결정은 실용적인 문제다. 이 모델이 허용 가능한 품질로 끝낼 수 있는 작업은 무엇인가? 얼마나 많은 노력이 필요한가? 모델이 끝났다고 말한 뒤 사람에게는 얼마나 많은 일이 남는가?
Berman의 약 17분짜리 영상 전체 자막을 검토하고 출시 정보와 제품 문서, Artificial Analysis의 평가를 확인했다. 아래 분석에는 BIG CHANGE 자체의 벤치마크나 직접 Grok을 시험했다는 주장이 포함되지 않는다.
무엇이 출시됐고 어디서 이용할 수 있나
표준 모델은 xAI API에서 제공되며 grok-4.7, Cursor와 Grok Build에서도 이용할 수 있다. API는 텍스트와 이미지를 입력으로 받아 텍스트를 출력한다. 문서에 기재된 컨텍스트 창은 50만 토큰이며 추론 설정은 low, medium, high, xhigh 네 가지다. 기본값은 high다. 공식 출시 노트
SpaceXAI는 더 큰 기반 모델과 어려운 작업에 대한 더 긴 강화학습이 개선의 원인이라고 설명한다. 이는 개발사의 설명이다. 출시 기술 개요
Grok 4.7 Fast도 있다. 문서는 더 빠른 인프라에서 같은 모델을 제공한다고 설명하며 표준 토큰 요금의 두 배를 청구한다. Cursor와 Grok Build에서 제공되고 Grok Build 무료 요금제에는 포함되지 않으며 공개 xAI API에서는 이용할 수 없다. Grok 4.7 제품 문서
스크린샷과 시연, 청구액을 비교할 때 이런 차이는 중요하다. 모델 버전과 추론 강도, 서비스 등급은 서로 별개의 선택이다. xhigh 설정의 Fast 시연은 표준 속도, medium 강도의 API 호출 경험이나 비용을 추정하는 근거가 아니다.
출시 페이지의 다른 모델과 비교한 내용은 업그레이드 비교와도 구분해야 한다. SpaceXAI에 따르면 표준 Grok 4.7은 Grok 4.6과 가격과 속도가 같다. Grok 4.6에서 업그레이드하면 고객 청구액이 자동으로 절반이 된다는 뜻은 아니다.
요금표에는 긴 컨텍스트 구간이 있다
공개된 표준 API 요금은 다음과 같다:
- 프롬프트 20만 토큰 이하: 입력 2달러, 캐시 입력 0.50달러, 출력은 토큰 백만 개당 6달러.
- 프롬프트 20만 토큰 초과: 입력 4달러, 캐시 입력 1달러, 출력은 토큰 백만 개당 12달러.
이는 토큰 요금이지 에이전트가 작업을 끝내는 데 드는 모든 비용을 포함한 가격은 아니다. 모델 페이지는 20만 토큰을 넘는 요청에 더 높은 요금이 적용된다고 알리고 출시 노트는 해당 요율을 명시한다. 가격과 이용 가능 여부는 9월 22일 확인했다. 모델 가격 및 출시 노트
따라서 컨텍스트 창이 50만 토큰이라고 해서 그 안의 모든 요청에 가장 낮은 요금이 적용되는 것은 아니다. 큰 컨텍스트 창만으로 대량의 파일 중 관련 세부 사항을 모델이 매번 찾아낸다고 볼 수도 없다.
Cursor는 제품별 차이를 더한다. 문서에는 표준 컨텍스트 창 25만 6천 토큰과 최대 50만 토큰이 기재되어 있다. 편집기에서 제공되는 용량은 API 사양과 다르거나 선택한 모드에 따라 달라질 수 있다. Cursor의 Grok 4.7 문서
긴 보고서를 처리하는 팀에게 당장 중요한 질문은 자료 전체를 넣는 것이 비용을 정당화할 만큼 결과를 개선하는지 여부다. 관련 부분만 가져오면 더 저렴하고 확인하기 쉬울 수 있다. 때로는 문서 전체가 필요하지만 때로는 프롬프트를 구성하기 가장 쉬운 방법일 뿐이다. 두 상황을 같은 예산으로 계산해서는 안 된다.
성능 향상에 토큰을 더 쓸 수 있다
Artificial Analysis가 9월 21일 발표한 평가에서 xhigh 설정 Grok 4.7은 Intelligence Index 46점을 받아 Grok 4.6보다 2점 높았다. 작업당 출력 토큰은 약 8만 1천 개로, high 설정 Grok 4.6의 3만 6천 개와 비교된다. 같은 보고서에서 Grok 4.6의 xhigh 설정은 3만 8천 개로 나타났다. 같은 강도로 비교해도 출력 토큰이 두 배 넘게 늘어난다. Artificial Analysis의 출시 평가
이는 토큰 가격과 작업 비용을 구분해야 하는 구체적인 이유다. 출력 8만 1천 토큰을 기본 요율인 토큰 백만 개당 6달러로 계산하면 예시 출력 요금은 0.486달러다. 3만 8천 토큰이면 0.228달러다. 이 계산에는 입력과 캐시 이용, 도구 비용, 상위 컨텍스트 요금, 실패한 시도가 의도적으로 포함되지 않았다. 보고된 토큰 수를 사용한 산술 계산이지 작업 전체 비용을 측정한 값은 아니다.
출력이 많다고 반드시 낭비인 것은 아니다. 모델이 답을 확인하는 데 더 많은 노력을 들여 사람이 개입해야 하는 실패를 피할 수 있다. 반대로 잘못된 접근을 오래 붙들고 있을 수도 있다. 토큰 수만으로 생산적인 끈기와 값비싼 반복을 구분할 수 없다.
Berman은 영상 후반에 이 문제를 다시 다루면서 Artificial Analysis가 보고한 높은 토큰 사용량을 언급한다. 영상, 15:43
유용한 결과는 승인된 산출물이다. 적절한 시험과 검토를 통과한 코드 변경, 수식이 맞는 스프레드시트, 근거를 추적할 수 있는 보고서는 단지 빨리 나온 답과 가치가 다르다.
벤치마크에서 모델은 역량이 있지만 성적이 고르지 않다
출시 표에서 xhigh Grok 4.7은 CursorBench 4.0에서 46.3%를 기록해 Fable 5.1 max의 51.8%보다 낮다. Fable은 Terminal-Bench 비교에서도 앞선다. 업체 벤치마크 표
함께 실린 차트는 벤치마크 점수를 출력 토큰과 비교하며 오른쪽으로 갈수록 토큰이 줄어든다. 각 선은 추론 설정을 비교한다. 원본 인터랙티브 차트: 토큰 선택. 전체 크기 차트 열기.

위쪽으로 이동하면 점수가 높고 오른쪽으로 이동하면 이 평가에서 생성 토큰이 적다. 전체 비용이 낮다는 뜻은 아니다. 토큰 요금과 입력 사용량, 주변 에이전트도 영향을 준다. 이는 앞서 나온 Artificial Analysis 토큰 수와 다른 시험이다. 작업과 방법론 차이를 지워 버리므로 두 결과의 수치를 합쳐서는 안 된다.
이 정도면 Grok 4.7이 모든 종류의 코딩 작업에서 선두라는 포괄적인 주장을 배제할 수 있다. 특정 작업에 관해 자세히 살펴볼 이유도 충분하다. 한 평가의 개선 폭이 익숙하지 않은 저장소나 불완전한 버그 보고서, 특이한 도구 환경을 다루는 방식을 정해 주지는 않는다.
Artificial Analysis는 유용한 독립적 구분을 제공한다. 해당 보고서는 Grok Build 에이전트를 사용한 Grok 4.7의 Coding Agent Index 점수가 56점으로, 같은 에이전트를 사용한 Grok 4.6의 47점보다 높다고 밝혔다. 이 자체 에이전트 결과를 표준화된 Intelligence Index 설정과 명확히 구분한다. 독립 평가와 방법론에 대한 설명
주변 에이전트도 중요하다. 에이전트가 도구를 제공하고 컨텍스트를 관리하며 모델의 요청이 어떻게 실행되는지 결정한다. 모델 이름이 같아도 환경이 달라지면 결과가 달라질 수 있다. 서로 다른 환경의 터미널 점수와 소프트웨어 엔지니어링 점수를 합치면 실제로 시험한 시스템을 나타내지 않는 설득력 있는 표가 만들어질 수 있다.
Berman은 출시 표 하나에 GPT-6 Astra가 빠졌다고 지적한 뒤 AI 생성 재구성으로 추가한다. 이는 비교를 조사할 계기가 될 수 있지만 해당 재구성은 독립 벤치마크 자료가 아니다. 기초 평가를 확인하지 않은 추가 수치는 채택하지 않는다. 영상, 6:03
함께 고려할 상업적 관계도 있다. Cursor의 8월 14일 회사 발표에 따르면 SpaceX가 인수했다. 같은 기업 집단에서 공개한 벤치마크도 유용한 근거이지만 경쟁 공급자에 대한 이해관계 없는 평가는 아니다. Cursor 인수 발표
사무 업무가 더 흥미로운 기회일 수 있다
독립 평가에서 xhigh 설정 Grok 4.7은 AA-Briefcase 점수 1,657 Elo를 기록했으며 high 설정 Grok 4.6보다 111 높았다. 개선의 상당 부분은 분석 품질에서 나왔고 표현 품질은 이전 모델보다 약간 낮다고 보고한다. Artificial Analysis의 지식 업무 결과
이런 차이는 보고서와 스프레드시트, 프레젠테이션을 맡기는 사람에게 유용하다. 분석은 나아졌어도 편집이나 재설계가 필요할 수 있다. 반대로 잘 다듬어진 자료가 얕은 추론을 가릴 수도 있다. 겉으로 보이는 완성도만 평가하면 잘못된 개선에 보상을 줄 수 있다.
운영팀은 반복하는 실적 보고서로 모델을 시험할 수 있다. 올바른 기간을 사용했는지, 원자료와 수치를 대조했는지, 관찰된 변화와 제안된 설명을 구분했는지를 확인하는 것이 유용하다. 검토자는 보고서가 처음 보기에 전문적으로 보였는지만이 아니라 얼마나 수정해야 했는지도 기록해야 한다.
소기업은 가장 어려운 벤치마크에서 이기는 것보다 감당하기 어렵던 분석을 일상 업무로 만드는 데 더 관심이 있을 수 있다. 이는 AI 도입이 넓어질 수 있는 현실적인 경로다. 결과가 충분히 정확하고 제때 도착하며 소유자가 직접 했을 때보다 일을 줄여 줄 때 현실이 된다.
전문가용 벤치마크라는 표기를 전문 자격으로 오해해서는 안 된다. 법률 업무나 임상 추론 점수는 해당 평가에서의 수행을 설명한다. 모델이 고객의 법률 문제를 독립적으로 처리하거나 환자 치료 결정을 내릴 수 있음을 입증하지는 않는다. 이 글은 그런 결정에 Grok을 사용하라고 권하지 않는다.
보호 장치 주장도 맥락에 따라 평가해야 한다
SpaceXAI는 Grok 4.7에 새로운 보호 장치와 강화된 탈옥 저항성이 있다고 주장한다. 이는 출시 때의 설명이지 모델을 사용하는 모든 애플리케이션이 안전하다는 보장은 아니다. 개발사의 안전성 설명
기업용 에이전트에는 적어도 두 가지 질문이 남는다. 모델은 받은 요청에 적절히 응답하는가? 애플리케이션은 모델이 실제로 할 수 있는 일을 제한하는가?
모델은 고객 기록을 변경하라는 지시를 정확히 이해하더라도 실제 변경 권한은 없을 수 있다. 요약하라고 받은 문서에 삽입된 악의적인 지시를 마주칠 수도 있다. 접근 통제와 승인 규칙은 주변 시스템의 일부로 남아야 한다. 거부 행동이 개선돼도 이를 대체하지 않는다.
실무적으로는 전체 작업 흐름을 시험해야 한다. 성공해야 하는 정당한 요청과 차단해야 하는 금지 행위, 확인을 위해 멈춰야 하는 모호한 사례를 포함한다. 무해한 작업도 자주 거부하는 제품은 쓸 수 없을 수 있고 허가되지 않은 작업을 실행하는 제품은 훨씬 위험할 수 있다. 어느 문제도 단일 대표 점수에는 담기지 않는다.
영상이 해결하지 못한 질문
Berman의 분석은 몇 가지 질문을 제기하며 답은 여전히 열려 있다. 가격과 사용 가능한 연산량을 연결한 그의 설명은 시장 해석이지 공개된 단위 비용 회계 자료가 아니다. 그가 언급하는 소셜미디어 예측은 성능이 실제로 나왔다는 증거가 아니라 기대다. 마지막 시연을 비교하면서도 어떤 설정을 사용했는지 모른다고 본인이 인정한다. 가격 논의, 8:44, 기대, 11:51 및 시연 논의, 15:20
영상은 공개 가중치 모델도 다룬다. 이런 더 넓은 경쟁 흐름을 Grok 4.7의 라이선스와 혼동해서는 안 된다. Artificial Analysis는 이번 출시가 독점 모델이며 가중치를 이용할 수 없다고 설명한다. Grok 4.7 출시 정보
이 차이를 구분하면 평가의 초점을 유지할 수 있다. 공개되지 않은 이유로 제공자가 매력적인 가격을 책정할 수도 있다. 인상적으로 실패한 시연은 다시 시험해 볼 만한 과제를 찾아낼 수 있지만 모델 전반이 형편없음을 증명하지는 않는다. 현재 이용할 수 있는 모델도 과거 창업자의 예측에 미치지 못하면서 유용할 수 있다.
후원 콘텐츠와의 경계도 있다. Berman의 영상에는 Zapier 광고가 포함되어 있다. 이는 Grok 성능에 관한 독립적인 근거가 아니며 광고성 주장을 BIG CHANGE의 추천으로 볼 수 없다.
더 나은 구매 지표: 승인된 작업당 비용

Grok 4.7을 고려하는 팀은 작고 대표성 있는 업무 표본으로 현재 작업 방식과 비교해야 한다. 결과를 보기 전에 승인 기준을 정한다. 코딩이라면 관련 시험 통과와 읽기 쉬운 변경 사항, 무관한 수정이 없다는 점을 포함할 수 있다. 분석이라면 계산이 정확하고 중요한 주장에 근거가 있는지를 볼 수 있다.
그런 다음 전체 청구액을 기록한다. 입력 및 출력 사용량과 도구, 재시도, 결과를 검토하거나 고치는 데 든 시간을 포함한다. 실패한 시도도 세어야 한다. 이 비용을 승인 기준을 통과한 산출물 수로 나눈다.
간단한 예를 보면 이 구분이 중요한 이유를 알 수 있다. 어떤 설정이 작업 묶음에 20달러를 써서 승인된 결과 80개를 낸다면 인건비 전 측정 비용은 결과당 0.25달러다. 다른 설정은 12달러를 쓰고 승인된 결과가 30개라면 결과당 0.40달러다. 총액이 싼 묶음이 실제 활용 가능한 작업의 출처로는 더 비싸다. 이는 가상의 수치이지 Grok 측정 결과가 아니다.
추론 강도도 시험의 일부여야 한다. 고강도 설정은 어려운 과제에서 비용만큼의 효과를 내고 단순한 과제에서는 별로 추가하지 않을 수 있다. 라우팅 결정 자체를 평가한다는 조건 아래 필요 사례에만 높은 강도를 적용하는 편이 모든 요청에 xhigh를 쓰는 것보다 경제적일 수 있다.
모델 간 검토 기준을 일정하게 유지해야 한다. 저렴한 모델에 더 낮은 기준을 적용하면 품질이 낮은 작업을 받아들여 절감한 것처럼 보인다. 기존 모델에만 기준을 높게 적용해도 반대 방향으로 왜곡된다. 목표는 사람이 여전히 무엇을 해야 하는지 명확히 설명하면서 신뢰할 만한 결과를 구매하는 것이다.
주목할 변화
Grok 4.7은 팀이 시험해 볼 선택지를 하나 더 제공한다. 채택하려면 모델이 무엇을 만들고 무엇을 소비하며 누군가가 무엇을 계속 고쳐야 하는지 등 작업 전체를 살펴야 한다.
더 큰 결과는 일상 업무에서 AI를 더 선별적으로 쓰는 것일 수 있다. 정기 분석에는 하나의 설정을, 까다로운 코딩에는 다른 설정을, 판단이나 책임을 위임할 수 없는 사례에는 사람을 택할 수 있다. 경쟁이 늘면 시험해 볼 선택지는 늘지만 어느 선택이 이겨야 하는지 정해 주지는 않는다.
BIG CHANGE가 다음으로 주목하는 이정표는 총노력이 줄면서 측정 가능한 작업이 완료되는지다. Grok 4.7이 승인된 산출물의 비용을 낮추면 더 많은 조직이 유용한 자동화를 활용할 수 있다. 추가 추론이 비용을 토큰 가격에서 사용량으로 옮기는 데 그친다면 표면적인 요금만으로 구매자는 거의 알 수 없다. 처음 실패한 사례까지 포함해 완료된 작업이 답을 보여 줄 것이다.



