xAI「Grok 3.5」공식 출시——실시간 추론×웹 통합으로 리서치 업무의 프로세스 설계가 바뀐다
機械翻訳 / Machine-translated
xAI가 2026년 8월 23일, 새 모델 「Grok 3.5」를 공식 출시했다. 가장 큰 변경점은 추론(Chain-of-Thought) 단계 도중에 실시간 웹 검색을 호출하는 「Live Grounding」 아키텍처의 채택이다. 「검색한 후 추론하는」 기존 흐름이 아니라, 추론하면서 필요한 부분에만 검색을 삽입하는 설계는 정보의 최신성과 추론 정확도를 동시에 요구하는 리서치·조사 업무에 직접적인 영향을 미친다.
xAI 공식 발표에 따르면, Grok 3.5는 다음과 같은 벤치마크 결과를 공개했다.
Live Grounding은 사고 토큰을 생성하는 도중에 「검색 노드」를 동적으로 삽입하는 구조로, 모델이 「자신의 지식이 오래되었거나 불확실하다고 판단하는 시점」에 웹 검색을 실행한다. xAI 발표 자료에 따르면, 사실 확인 태스크에서 환각(hallucination) 발생률이 기존 Grok 3 대비 약 41% 감소했다고 한다.
X(트위터)에서는 공개 직후부터 검증 트윗이 잇따랐다.
「Grok 3.5에 경쟁사 분석 보고서를 요청했더니 중간에 알아서 각 회사의 IR 자료를 가져왔다. 검색 지시 없이 이게 작동하는 건 구조 자체가 다른 것」
(기업 리서처, 팔로워 약 1.2만 명)
API 제공은 오늘부터 시작. 입력 100만 토큰당 $8.00, 출력 $24.00의 가격으로, GPT-4.5 Turbo와 동일한 수준으로 설정되어 있다.
Grok 3.5의 출시 타이밍은 최근 몇 주간 이어진 추론 모델 경쟁의 연장선상에 있다. OpenAI가 o4, Google이 Gemini 2.5 Ultra를 각각 공개하며 벤치마크 상위권은 거의 엇비슷한 상황이다. 차별화의 초점은 「정확도」에서 「정보의 최신성」과 「에이전트 통합 가능 여부」로 이동하고 있으며, xAI는 그러한 맥락에서 Live Grounding을 앞세워 참전한 형국이다.
xAI는 Grok 3에서 X(구 Twitter)의 실시간 데이터 접근을 강점으로 내세워 왔지만, Grok 3.5에서는 이를 모델 내부 아키텍처에 통합함으로써 X에 국한되지 않고 범용 웹으로 검색 범위를 확장하고 있다.
기존의 RAG(검색 증강 생성)나 툴 호출형 에이전트는 검색→취득→입력→추론이라는 순차 구조를 취한다. Live Grounding은 추론 도중에 검색을 삽입하기 때문에, 「가설을 세우면서 검증하는」 인간적인 리서치 프로세스에 가까운 동작 방식을 보인다. 구체적으로는, 경쟁사 조사·문헌 조사·팩트체크를 수반하는 분석 보고서 생성 태스크에서 공정 수가 줄어들 것으로 보인다.
512,000토큰의 컨텍스트는 약 400페이지 분량의 문서를 일괄 처리할 수 있는 용량이다. 결산 자료의 다기간 비교, 계약서 검토, 대규모 코드베이스의 횡단 분석 등 「긴 문서를 통째로 넘겨서 질문하는」 용도에서 실용적인 수준에 진입한다. 단, 장문 컨텍스트에서 추론 정확도가 유지되는지는 독립적인 검증이 필요하며, 공식 발표 수치만으로 판단하기에는 이른 감이 있다.
$8/$24(입력/출력, 100만 토큰)는 Claude Opus 4.6의 $15/$75, GPT-4.5 Turbo의 $10/$30와 비교했을 때 입력 비용 면에서 유리한 설정이다. 비용 최적화를 우선시하는 엔터프라이즈 조달에서 선택지로 고려될 수준으로 보인다.
현재 API 사양은 OpenAI 호환 엔드포인트를 제공하고 있으며, LangChain·LlamaIndex·Claude Agent SDK 등 주요 프레임워크에서의 스왑인이 상정된다. Live Grounding 기능 자체는 API 호출 시 파라미터(live_grounding: true)로 제어할 수 있어, 에이전트 파이프라인 설계자가 기존 워크플로우에 통합하기 쉬운 구조로 되어 있다.
xAI는 Grok 3.5와 동시에 엔터프라이즈용 「Grok for Teams」 플랜의 확장도 발표했다. 시트당 월 $40에 우선 API 접근권과 감사 로그가 포함된다. 기업 이용의 거버넌스 요건을 의식한 움직임으로, 지금까지의 「개인 사용자 선행」 노선에서의 전환으로도 읽힌다.
이번 발표에서 가장 주목하는 것은 Live Grounding이라는 기능 자체보다, 「추론과 검색의 경계를 없애는」 설계 사상이다. 모델이 자율적으로 「지금 여기서 검색해야 한다」고 판단하는 구조는, 에이전트 설계자 입장에서 하나의 루프를 줄일 수 있다는 점에서 실용적 가치가 있다.
단, 검색 타이밍의 제어가 블랙박스인 점은 리스크로 남는다. 어느 타이밍에 무엇을 검색했는지의 추적 가능성(traceability)이 보장되지 않는다면, 감사가 필요한 업무(법무·컴플라이언스·재무 리포팅)로의 확대는 신중하게 접근할 수밖에 없다. xAI가 「검색 로그의 API 제공」에 나설지 여부가 엔터프라이즈 채택의 분기점이 될 것으로 보인다.
경쟁사 모델들이 추론 정확도 수치에서 엇비슷해진 지금, 차별화의 전장은 「정보의 최신성」과 「에이전트 통합 비용」으로 이동하고 있다. 그 관점에서 Grok 3.5의 포지셔닝은 명확하다. 단, Live Grounding이 실제 태스크에서 주장대로의 정확도 개선을 가져올지는, 앞으로 2~4주 안에 나올 독립적인 재현 실험 결과를 기다리고 싶다.
xAI「Grok 3.5」의 본질은 추론 루프 내 실시간 검색 통합이라는 구조적 변화에 있다. 벤치마크 수치 경쟁에서 한 발 물러나, 「정보 최신성」을 설계에 내재화한 점에서 리서치·조사 계열 업무에 대한 영향은 직접적이다. 다음 초점은 Live Grounding 기능의 추적 가능성 사양 공개와, 독립 기관에 의한 재현 평가 결과가 될 것이다. 엔터프라이즈 조달 담당자라면 이번 주 중에 나올 서드파티 벤치마크 보고서를 기다린 후 판단하는 것이 타당할 것이다.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(AI뉴스)가 작성했습니다.