TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 25 READS

xAI 그록 4.7 공개: 가격은 그대로, 코딩·장기 작업 성능을 끌어올린 실속형 업그레이드

xAI 그록 4.7 공개: 가격은 그대로, 코딩·장기 작업 성능을 끌어올린 실속형 업그레이드
SOURCE IMAGE · HACKER NEWS

xAI가 코딩과 지식 노동에 초점을 맞춘 새 모델 그록 4.7을 내놓았다. 회사는 이 모델을 자사에서 가장 유능한 모델로 소개하면서도, 가격과 응답 속도는 직전 버전인 그록 4.6과 동일하게 유지했다고 밝혔다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러라는 요금은 변하지 않았고, 출력 속도를 두 배로 높인 고속 변형(fast variant)은 두 배 요금으로 별도 제공된다. 새 버전이라고 가격을 올리는 대신 같은 값에 더 나은 결과를 주겠다는 포지셔닝인 셈이다.

무엇이 달라졌나

그록 4.7은 4.6보다 더 큰 새 기반 모델 위에서 만들어졌다. xAI는 여기에 더 긴 강화학습(RL) 과정을 적용했는데, 학습 과제 구성을 완료까지 여러 시간이 걸리는 어려운 문제 쪽으로 의도적으로 치우치게 했다고 설명한다. 그 결과 모델이 어려운 작업에 더 오래 매달리고, 자신의 결과물을 스스로 더 꼼꼼히 검증하며, 긴 맥락을 다루는 능력이 개선됐다는 것이 회사의 주장이다. 짧은 질의응답보다 장시간 이어지는 실무형 작업에서 강점을 겨냥한 방향성이다.

또 하나 눈에 띄는 점은 그록 봇 하네스(Grok Bot harness)를 모델이 기본적으로 이해하도록 학습시켰다는 대목이다. 특정 대화·도구 실행 환경을 모델이 태생적으로 파악하게 함으로써 대화형 작업과 일반 지식 업무의 완성도를 높였다는 설명인데, 이는 모델과 이를 감싸는 실행 환경을 함께 최적화하는 최근 업계 흐름과 맞닿아 있다.

벤치마크로 본 위치

xAI는 장시간 코딩 작업을 부담스럽게 검증하는 CursorBench 4.0에서 그록 4.7이 가격 대비 성능 측면의 프런티어에 있다고 밝혔다. 문서·프레젠테이션 작성 능력도 개선됐다고 강조하는데, 근거로 든 것은 변호사·간호사·재무분석가 등 전문직의 실제 업무를 모사한 GDPval과 AA Briefcase 벤치마크다. 두 지표에서 4.6 대비 향상됐고 다른 프런티어 모델들과 비슷한 수준을 보인다는 것이 회사의 표현이다. 다만 여기서 유의할 점은 '경쟁 모델 대비 두 배 빠르고 절반 가격'이라는 마케팅 문구와 '다른 프런티어 모델과 대등하다'는 벤치마크 서술이 섞여 있다는 것이다. 압도적 우위라기보다는 동급에서 가격·속도 효율이 좋다는 주장으로 읽는 편이 실제에 가깝다.

안전장치와 이중용도 영역

이번 발표에서 xAI가 상당한 분량을 할애한 부분은 안전성이다. 그록 4.7은 완전히 새로운 세이프가드 스택 위에서 만들어졌으며, 거부(refusal)와 탈옥(jailbreak) 저항성에서 자사가 시험한 모델 중 가장 강하다고 밝혔다. 사이버보안이나 생물학처럼 이중용도(dual-use) 성격이 강한 영역에서, 정당한 목적의 작업에는 응답하면서 위험한 요청은 거부하는 균형을 목표로 했다는 것이다. 생물안전 벤치마크인 LatchBio에서 62.4%로 선두를 차지했다고 제시했다.

사이버 영역에서는 위험·악성 작업을 평가하는 자체 벤치마크 HackerBench v0.3에서 가장 높은 안전성을 기록했다고 밝혔다. 위험한 이중용도 프롬프트의 3.3%만 통과시키면서 정당한 보안 작업은 거의 차단하지 않았다는 수치다. 나아가 xAI는 일부 사이버보안 파트너에게 그록 4.7의 레드팀 역량을 초대제(invite-only)로 개방해 방어 연구에 활용하도록 하기 시작했다고 덧붙였다. 공격에 쓰일 수 있는 능력을 제한된 협력사에만 여는 방식은, 보안 실무자 입장에서 접근성과 통제 사이의 절충으로 볼 수 있다.

실무 관점의 정리

국내 개발·기획 실무자에게 실질적으로 의미 있는 지점은 도입 경로다. 그록 4.7은 발표 시점부터 Cursor와 Grok Build에서 쓸 수 있고, Grok API는 물론 서드파티 코딩 하네스, 모델 라우터, 클라우드 플랫폼을 통해서도 접근할 수 있다. 즉 기존 코딩 도구 체인에 비교적 쉽게 얹어 시험해 볼 수 있는 구조다. 다만 공개된 정보는 전적으로 제조사가 제시한 자체 벤치마크와 수치에 기반한다는 한계가 있다. 독립적인 제3자 평가나 실제 프로덕션 환경에서의 장기 검증 결과는 아직 확인되지 않았으므로, 가격·속도 이점을 근거로 삼되 자사 워크로드에서 직접 소규모 파일럿으로 성능과 안전 거부율을 검증한 뒤 도입 폭을 넓히는 접근이 합리적이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://x.ai/news/grok-4-7
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...