|
매트릭스(MatrAIx): 83억 페르소나 에이전트로 세계를 시뮬레이션하다
하버드대(Harvard)의 샤오민 리(Xiaomin Li), 매사추세츠공대(MIT)의 웨싱 하오(Yuexing Hao)
하버드대(Harvard)의 샤오민 리(Xiaomin Li)와 매사추세츠공대(MIT)의 웨싱 하오(Yuexing Hao)가 주도한 대규모 공동 연구입니다. 인공지능은 중국에 사는 중국인이 하느냐 미국에 온 중국인이 하느냐의 차이라는 우스개 소리가 있죠.
자문위원으로 던 송(Dawn Song), 제임스 저우(James Zou), 마린카 지트니크(Marinka Zitnik), 아수 외즈다을라르(Asu Ozdaglar) 등이 참여했습니다. 연구진은 사람 대신 인공지능(AI) 페르소나(persona)가 제품을 써보고 평가하는 인프라를 만들었습니다.
핵심은 세 가지입니다. 첫째, 배경·심리·역량·행동·라이프스타일을 아우르는 1,290개 차원의 공통 스키마(schema)로 기술한 페르소나 83억 건, 즉 '페르소나 8B(Persona 8B)'입니다. 위키피디아(Wikipedia) 인물, 아마존 리뷰(Amazon Reviews) 이력, 스택오버플로 개발자 설문(Stack Overflow Developer Survey), 종합사회조사(GSS) 등 실제 데이터에 기반한 59만 9,847건과 합성 40만 건을 추린 100만 명 규모 코어셋(coreset)은 허깅페이스(Hugging Face)에 공개했습니다. 합성 페르소나는 속성 간 상관을 유지하는 방향성 비순환 그래프(DAG)로 생성해 "영어가 모국어인데 영어 실력은 없음" 같은 모순을 차단합니다.
둘째, 이 페르소나가 설문(Survey)·AI 챗봇(Chatbot)·웹(Web)·앱(App) 네 환경에서 직접 제품과 상호작용하는 실행 환경 '매트릭스 플레이그라운드(MatrAIx Playground)'입니다.
셋째, 커머스·소프트웨어·금융·헬스케어 등 25개 이상 분야를 다루는 재사용 가능한 평가 과제 1,010개입니다. 연구진은 클로드 오퍼스 4.8(Claude Opus 4.8), GPT-5.5, 클로드 하이쿠 4.5(Claude Haiku 4.5)로 페르소나를 구동해 8개 대표 과제에서 1만 8,189회 평가를 수행했고, 별도 400회 통제 실험에서 에이전트가 부여받은 성향대로 행동한 비율이 91.5%였다고 보고했습니다.
의미는 '평가 방식의 전환'에 있습니다. 지금까지 AI 벤치마크(benchmark)는 과제를 완수했는지만 측정했습니다. 하지만 실제 사용자 경험은 같은 답변이라도 초보자냐 전문가냐, 가격에 민감하냐 아니냐에 따라 완전히 갈립니다. 이 논문은 그 차이를 평균 점수 뒤에 숨기지 않고 집단별로 드러내는 방법을 제시합니다. 실제 실험에서도 페르소나 배경에 따라 가격 인상 후 구매 의향, AI 어시스턴트가 실패했을 때 계속 쓸지 여부, 응답 지연 감내 수준이 뚜렷하게 갈렸습니다.
제품팀 입장에서는 수 주가 걸리던 사용자 조사를 몇 시간짜리 초기 스크리닝(screening)으로 대체하고, 제품을 고칠 때마다 동일한 집단·과제로 반복 비교할 수 있다는 뜻입니다. 물론 시뮬레이션은 사람이 아닙니다. 연구진도 대규모언어모델(LLM)이 집단 내 다양성을 축소하거나 고정관념을 증폭할 수 있다는 선행 연구를 인정하며, 인간 평가를 대체하는 게 아니라 배포 전 실패 사례를 걸러내는 단계로 위치시킵니다. 그럼에도 페르소나 데이터·실행 환경·과제 라이브러리를 하나로 묶어 공개한 첫 사례라는 점에서, AI 제품 평가의 표준 인프라 후보로 볼 만하다고 봅니다.
논문 보기 →
|