Anthropic 상거래 AI 실험|70% 격차 '보이지 않는 불평등'의 전모
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
'AI에 쇼핑을 맡겼더니, 나도 모르는 사이에 손해를 보고 있다'——Anthropic이 2026년 4월에 공개한 사내 실험 'Project Deal'이 에이전트 시대의 숨겨진 격차를 처음으로 숫자로 증명했습니다.
고성능 Claude Opus 4.5에 대리를 맡긴 사람일수록 유리한 거래, 경량형 Haiku 4.5를 쓴 사람은 손해를 보는 냉혹한 결과.
그런데도 손해를 본 쪽은 알아차리지 못하는 '보이지 않는 불평등'의 전모를 누구나 알기 쉬운 말로 풀어봅니다.
먼저 실험의 전체 그림을 3분으로 정리합니다.
2025년 12월, Anthropic은 샌프란시스코 본사에서 'Project Deal(프로젝트 딜)'이라는 사내 마켓 실험을 1주일간 실시.
결과는 2026년 4월 24일 공식 발표되어 미국 미디어에 일제히 보도됐다.
'직원 전용 중고거래 앱에서, 출품도 구매도 전부 AI에 맡기는' 이미지.
69명의 직원에게 1인당 $100의 예산과 자신만의 Claude 에이전트를 지급.
집에 있는 불필요한 물건(스노보드, 탁구공, 루비까지 500점 이상)을 출품하고, 인간의 개입 없이 AI끼리 협상해 거래 성사.
1주일 동안 186건, 총액 4,000달러 이상의 거래가 성사됐다고 공식 발표했습니다.
마켓플레이스는 Anthropic 사내 Slack(채팅 툴) 위에 구축.
전용 채널에서 에이전트가 무작위로 순서를 돌며, 출품·가격 책정·협상·성사까지 전자동.
'학교 플리마켓에서, 학생 대신 책상 위에 올려둔 스마트폰끼리 채팅으로 가격을 협상하는' 감각.
실험이 시작되면 인간은 도중에 개입할 수 없는 설계.
사전에 Claude가 각 직원에게 '무엇을 팔고 싶은지·무엇을 사고 싶은지·예산은 얼마인지'를 인터뷰해 시스템 프롬프트를 작성.
이후 Claude가 대리인으로서 24시간 계속 작동하는 구조였습니다.
Anthropic은 4개의 독립 마켓(A~D)을 병행 운영해 비교 분석.
Runs A와 D는 전원 Claude Opus 4.5(최상위 모델).
Runs B와 C는 50% 확률로 Claude Haiku 4.5(경량 모델)에 무작위 배정.
'같은 시험을 우등생만 있는 반과, 우등생+평균 수준 학생이 섞인 반에서 비교하는' 방식.
Run D가 실제 거래(실제 돈과 물건이 오가는), A·B·C는 연구용 시뮬레이션.
이 비교 설계가 'AI 성능 차이가 실제 경제에 어떤 영향을 미치는지'를 처음으로 가시화한 것이 가장 큰 성과입니다.
'어떤 격차가 나타났는지'를 세 가지 관점으로 살펴봅니다.
같은 상품이라도 대리 AI의 종류에 따라 가격이 크게 달라지는 사례가 빈발.
망가진 접이식 자전거는 Haiku 경유 $38, Opus 경유 $65(70% 높음).
루비(보석)는 Haiku에서 $35, Opus에서 $65(86% 차이).
'같은 중고품을 중고거래 앱에서 팔 때, 유능한 대리인이 붙은 사람만 고가에 팔 수 있는' 상태.
평균적으로 Opus 셀러는 거래 1건당 $2.68 더 비싸게 팔았다.
Opus 바이어는 거래 1건당 $2.45 더 저렴하게 샀다.
나아가 Opus 사용자는 성사 건수도 평균 2건 많아, 건수 면에서도 유리했습니다.
실험 후 설문에서, 참가자는 거래의 공정성을 1~7단계로 평가.
Opus 사용자와 Haiku 사용자의 공정성 점수는 4.06 대 4.05로, 거의 동일.
'학교 성적표에서 같은 "보통"을 받았지만, 실은 한쪽만 점수가 깎인' 상황.
Anthropic은 이를 'invisible inequality(보이지 않는 불평등)'라고 명명.
46%의 참가자는 '앞으로 이 서비스에 돈을 낼 의향이 있다'고 응답.
손해를 보고 있는데도 만족도는 높다는, 소비자 심리의 맹점이 드러났습니다.
'AI에 "강하게 협상해"라고 지시하면 격차가 줄어드는지'도 검증한 결과는 의외였다.
적극적인 협상 프롬프트를 줘도 가격 차는 줄어들지 않았다.
격차의 주요 원인은 '첫 가격 책정(오프닝 비드)'에 집중.
'바둑에서 첫 수 선택이 거의 승부를 결정하듯, AI도 첫 한 수로 결과가 결정되는' 이미지.
고성능 모델은 초기 가격의 정확도가 높고, 경량 모델은 가격 책정에서 손해를 보기 쉽다.
'프롬프트 궁리보다 기초 모델 성능'이라는, 에이전트 시대의 냉혹한 현실이 떠올랐습니다.
'다른 회사들은 어떻게 움직이고 있는지'를 세 가지 축으로 정리합니다.
OpenAI는 결제 대기업 Stripe와 손잡고 'Agentic Commerce Protocol(ACP)'을 2025년 9월부터 본격 가동.
ChatGPT에서 '이 신발 사줘'라고 부탁하면, AI가 Walmart나 Best Buy에서 자동 구매.
'편의점 계산원이 스마트폰 너머로 쇼핑 대행을 해주는' 감각.
GPT-5 mini에 강화학습을 결합해, 여러 소매 사이트를 넘나들며 비교·구매.
2026년 시점에서 미국 주요 EC 수십 곳이 ACP 대응 완료.
OpenAI와 Anthropic은 철학이 달라, OpenAI는 '편의성 우선', Anthropic은 '안전성 우선' 입장입니다.
Google은 2026년 1월에 Universal Commerce Protocol(UCP)을 발표.
Google 검색의 AI Mode, Gemini 양쪽에서 'Buy for me' 버튼이 미국 주요 소매업체에서 작동 중.
'쇼핑 AI 비서가 전국 모든 가게에서 쓰일 수 있는' 상태를 목표로 하는 규격.
UCP는 업계 연합(코얼리션)형으로 Mastercard·Visa와 연계.
ACP가 OpenAI·Stripe 주도의 '닫힌' 규격인 것에 비해, UCP는 '열린' 설계.
2026년 EC 시장에서 AI 경유 구매는 $209억(약 30조 원)에 달할 것으로 업계는 예측합니다.
Anthropic은 ACP·UCP에 중립적 입장을 취하며, 자사 'Model Context Protocol(MCP)'로 독자 생태계를 추진.
MCP는 AI 에이전트가 외부 툴이나 데이터베이스를 사용하기 위한 공통 규격.
'AI가 문구점의 도구를 빌려 쓸 수 있도록 하는 통합 열쇠' 같은 구조.
Project Deal도 MCP 기반으로 구축되어, Slack과 연계.
Anthropic은 '거래하기 전에, AI끼리의 격차를 측정한다'는 자세를 취하는 신중파.
OpenAI·Google이 공격적인 보급을 추진하는 한편, Anthropic은 '안전하게 보급하기 위한 연구'에 주력.
2026년 하반기를 향해 3사의 노선 대립이 뚜렷해지고 있습니다.
'일본 EC와는 어떤 관련이 있나?'를 세 가지 관점으로 살펴봅니다.
2026년 4월 시점에서, 일본의 주요 EC 사이트는 ACP·UCP 어느 쪽에도 미대응.
라쿠텐, Amazon Japan, Yahoo! 쇼핑은 AI 에이전트 결제 시스템을 공식 실장하지 않았다.
'해외여행지의 자동 개찰기에 일본의 교통카드가 사용되지 않는' 상태.
ChatGPT나 Gemini에서 '라쿠텐의 이 상품을 사줘'라고 부탁해도, 자동 구매가 되지 않는 구조.
다만 라쿠텐은 R-AI 플랫폼을 2026년에 확장할 예정으로, 독자 규격 대응 가능성도 있다.
일본 시장이 세계의 흐름에 뒤처지면, 해외 AI 쇼핑 경유로 '구매 기회를 빼앗기는' 일이 벌어질 것이라고 업계 관계자들은 경계하고 있습니다.
Project Deal은 직원 간 C2C 거래에서 격차가 발생한 사례로서, 메르카리나 ZOZOTOWN에도 경종을 울린다.
앞으로 메르카리에 'AI 에이전트에 매매를 맡기는 기능'이 추가된다면, AI 성능 차이로 손익이 달라진다.
'플리마켓에서 옆 출품자에게만 유능한 대리인이 있어, 내 물건이 싸게 팔리는' 사태가 벌어질 수 있다.
2026년 4월의 메르카리는 독자 AI '메르카리 AI'를 중고차·브랜드 상품 평가에 활용 중.
ZOZOTOWNも ZOZO MATCH에서 사이즈 추천에 AI를 사용하지만, 에이전트 거래는 아직 미실장.
일본의 중고 시장은 30조 원 규모, AI 보급으로 '보이지 않는 격차'가 확산될 토양은 충분합니다.
일본에서는 2025년 성립된 AI 추진법이 시행됐지만, 에이전트 거래에 특화된 규정은 없다.
소비자계약법도 AI가 대리인이 되는 계약을 상정하지 않고 있다.
'신호등은 생겼지만, 로봇 운전사의 통행 규칙은 미정비' 상태.
미국에서도 Anthropic이 지적하듯 'policy and legal frameworks(정책·법 정비)가 따라오지 못하고 있다'.
2026년 하반기, 경제산업성·총무성에서 'AI 에이전트 거래 가이드라인' 책정 논의가 가속화될 전망.
소비자청도 'AI가 협상한 계약은 누가 책임지는가'에 대한 논의를 시작.
Project Deal의 결과는, 일본의 법 정비에 있어서도 귀중한 실증 데이터가 될 것입니다.
도쿄의 IT 기업에서 일하는 쇼타 씨는 메르카리용으로 Claude API를 통해 출품 문구를 최적화 중.
'카메라 렌즈의 상태 설명을 Claude에 맡겨 쓰게 했더니 더 높은 가격에 팔렸다'고 효과를 실감.
Project Deal의 결과대로, 문장 생성 AI의 성능 차이가 매출을 좌우하는 시대의 도래.
'야구 타석에서 대타를 세우는 사람과 직접 치는 사람의 타율이 달라지는' 감각.
앞으로 메르카리에 에이전트 기능이 생긴다면, Claude Opus 구독자가 유리해질 가능성.
월 $20의 Claude Pro 구독자와 무료 사용자 간에 부업 수입이 달라지는 시대가 보이기 시작한 상황입니다.
오사카에 사는 유미 씨는 4인 가족의 식비·생활용품을 ChatGPT와 상담하며 쇼핑.
'같은 슈퍼마켓 상품이라도 AI가 알려주는 쿠폰 정보나 최저가 정보로 한 달에 3만 엔이 절약된다'고 말합니다.
앞으로 유미 씨가 사용하는 AI의 성능에 따라 가계 절약액이 달라질 우려가 현실적으로 다가온다.
'가계부를 쓰는 주부가 계산기 성능에 따라 연수입이 달라지는' 이상한 사태.
Anthropic이 경종을 울리는 '보이지 않는 불평등'은 가계 관리 수준에서도 일어날 수 있다.
소비자 보호 관점에서 '어떤 AI로 샀는지'를 표시하는 시스템이 앞으로 필요해질 것 같습니다.
아이치현에서 부품 상사를 운영하는 켄이치 씨는 해외 공급업체와의 가격 협상에 Claude Enterprise를 시험 도입.
'영문 메일의 초기 가격 제시를 Claude Opus 4.5에 맡겼더니 협상이 30% 원활해졌다'고 말합니다.
Project Deal이 보여주듯, 협상의 첫 가격이야말로 결과를 좌우하는 포인트.
'상담에서 첫 명함 교환이 분위기를 결정하는' 것과 같은 원리.
B2B 거래에서도 AI 에이전트의 성능 차이가 이익률에 직결되는 시대의 입구.
'고성능 AI 구독료는 비싸지만, 협상으로 회수할 수 있다'는 새로운 경영 판단 기준이 생겨나고 있습니다.
A. Anthropic은 실험 코드와 평가 프레임워크를 단계적으로 공개할 예정.
2026년 4월 시점에서는 완전한 오픈소스가 아니지만, 연구 커뮤니티에 상세 데이터를 공개.
도쿄대·교토대 등의 AI 경제학 연구실에서 일본 시장판 후속 실험이 시작될 가능성.
'요리 프로그램에서 사용한 레시피를, 시청자가 집에서 만들어 확인할 수 있는' 형태로 재현성을 담보.
다만 완전한 재현에는 대량의 Claude 크레딧이 필요해, 개인의 검증은 어렵다.
Anthropic 공식이 '업계 전체에서 재검증해달라'고 호소하고 있는 점은 중요합니다.
A. 2026년 4월 시점에서는, Claude Pro(월 $20)로 Opus 4.5에 접근할 수 있다.
무료 버전은 Sonnet·Haiku 기반으로, 에이전트 대리 거래에서는 불리할 가능성.
다만 일상 대화·문서 작성에서는 성능 차이가 작고, 용도에 따라 다르다.
'야구와 축구에서 같은 운동 신경을 사용하지만, 승부처가 다른' 감각.
'AI 에이전트에 대리 협상을 맡기는' 용도라면, 유료 플랜의 가치는 높다.
반대로 '정보 검색·요약' 정도라면, 무료로도 충분히 실용적.
2026년 하반기를 향해 '에이전트 특화 플랜' 등장 소문도 있어, 주목할 만합니다.
A. 2026년 4월 시점에서는, 일본 주요 C2C·EC 사이트는 AI 에이전트 거래 기능을 실장하지 않았다.
다만 OpenAI ACP·Google UCP의 세계적 보급으로, 2027년 이후의 대응이 예상된다.
'해외에서 유행한 간편결제가 3~5년 늦게 일본에도 침투하는' 패턴.
메르카리·ZOZO·라쿠텐이 독자 AI 기능을 강화하는 흐름은 가속 중.
앞으로 사용자가 선택하는 AI 플랜에 따라 거래 결과가 달라지는 'AI 격차 시대'가 일본에도 올 가능성.
소비자청이 'AI 에이전트 거래 가이드라인'을 정비하면 영향을 최소화할 수 있다고 전문가들은 제언하고 있습니다.
A. Anthropic은 'AI 에이전트 시대의 사회적 영향을 먼저 논의하기 위해' 공개한다고 설명.
CEO 다리오 아모데이는 '안전성 연구를 경제학에도 확장한다'는 방침을 표명.
'신약을 판매하기 전에 부작용을 모두 공개하는 제약회사' 같은 자세.
경쟁사 OpenAI나 Google이 '편의성'을 내세우는 한편, Anthropic은 '리스크 공개'로 차별화.
정책 결정자·기업·연구자에게 'AI 에이전트 시대의 격차 문제'를 생각할 재료를 제공.
'보이지 않는 불평등'이라는 말 자체가 업계 논의를 주도하려는 의도라고 볼 수 있습니다.
A. OpenAI의 GPT-5·GPT-4.1·Google Gemini에서도 유사한 성능 차이는 이론상 발생할 수 있다.
다만 각 사가 내부 실험 데이터를 공개하지 않아, 정량 비교는 어렵다.
Anthropic이 선행 공개한 점에서 '업계의 투명성 기준'을 만들었다.
'편의점 업계에서 한 회사만 식품의 세부 원산지 표기를 시작하는' 것 같은 효과.
OpenAI·Google도 앞으로 유사한 연구 공개를 요구받을 가능성.
사용자 입장에서는 'AI의 종류에 따라 거래 결과가 달라진다'는 전제로, 여러 서비스를 용도에 맞게 사용하는 것이 현실적.
2026년은 'AI 에이전트 비교 정보'가 새로운 분야로 급성장 중입니다.
'AI에 대리인을 맡긴 순간, 성능 차이가 조용히 격차를 벌린다'——단순한 사실을 Anthropic은 186건의 실제 거래로 증명했습니다. 2026년은 'AI 에이전트 결제'가 전 세계 EC에서 일제히 시작되는 원년.
ChatGPT로 사는가·Gemini로 사는가·Claude로 사는가, 어느 쪽을 선택하느냐에 따라 결과가 달라지는 시대의 도래.
일본에서는 메르카리·ZOZO·라쿠텐이 독자 대응을 서두르는 한편, 소비자청·경제산업성의 규제 논의도 2026년 하반기에 본격화될 전망.
'보이지 않는 불평등'을 가시화한 Project Deal은 AI와 공생하는 경제 사회의 설계도——직장인, 주부, 경영자, 누구에게나 '어떤 AI를 어떻게 쓰는가'가 일상의 손익을 가르는 새로운 분기점이 될 것입니다.
이 기사는 AI Friends의 크로스포스트입니다.