회계사 12명 모집해 AI와 대결해보게 했더니... 결과가 꽤나 충격적이다
작성일
공인회계사 3시간 붙잡은 결산, AI는 10분 만에 '만점'
공인회계사(CPA) 자격증을 가진 회계사들이 최대 3시간을 붙들고도 3분의 1 남짓밖에 풀지 못한 월말 결산 과제를 인공지능(AI)은 10분 안에 만점으로 끝냈다. 실험을 진행한 연구진조차 오해를 살까 봐 결과 공개를 망설였다고 털어놓았다.

AI 학습용 전문가 데이터 기업 머코어(Mercor)가 공인회계사와 최신 AI 모델의 회계 업무 수행 능력을 비교한 연구 결과를 1일(현지시각) 자사 블로그에 공개했다. 머코어는 미국 샌프란시스코에 본사를 둔 기업이다. 각 분야 전문가를 AI 연구소와 연결해 모델 학습과 평가에 쓰이는 데이터를 만든다.
에이든 바턴 머코어 연구원은 블로그에서 "이번 결과는 도발적이어서 오해를 살까 봐 공개하지 않는 방안도 검토했다"며 "사람과 기관이 빠르게 발전하는 AI에 대비하려면 투명하게 알리는 것이 중요하다고 판단했다"고 밝혔다.
회계사 평균 37%, AI는 20번 모두 만점
연구진은 미국 공인회계사 자격증을 보유한 회계사 12명을 모집했다. 참가자의 회계 경력은 평균 5년 반 정도다. 이들에게는 머코어가 지난 7월 공개한 회계 벤치마크 'APEX-어카운팅'의 과제를 간소화한 월말 결산 시나리오 4개가 주어졌다. 비영리단체 예산 배분, 호텔 매출과 수수료 정산, 이벤트 매출 분석, 리스 일정표 작성 등이다. 참가자는 회사 업무 파일을 뒤져 필요한 수치를 찾고 계산한 뒤 결과를 표로 정리해야 했다.
회계사들은 채점 기준 항목의 평균 37%를 충족하는 데 그쳤다. 개인별 정확도는 0%에서 90% 안팎까지 편차가 컸다. 과제 하나를 끝내는 데는 대부분 30분에서 180분이 걸렸다. 과제를 설계한 전문가들은 초급 회계사 30%, 중급 회계사 55% 수준의 점수를 예상했다.
앤트로픽의 '클로드 오퍼스 5'는 20차례 시도에서 모두 만점을 받았다. 과제마다 걸린 시간은 10분이 채 되지 않았다. 연구에 참여한 회계사 가운데 가장 잘한 사람보다도 정확도와 속도 모두에서 앞섰다.

비용 차이도 컸다. 채점 기준 1개를 충족하는 데 든 비용은 클로드 오퍼스 5가 0.21달러였다. 미국 회계사 중위 임금으로 환산한 회계사의 비용은 10.35달러로 49배에 달했다.
연구진은 원래 회계사가 AI의 도움을 받을 때 성과가 얼마나 오르는지 측정하려 했다. 하지만 AI 단독 점수가 이미 만점이어서 향상 폭을 잴 여지가 없었다. 결국 연구는 AI 도움 없이 작업한 회계사와 AI를 비교하는 방식으로 바뀌었다.
AI의 추격 속도도 눈에 띈다. 같은 과제에서 오픈AI의 'GPT-4o'는 0%에 가까운 점수를 받았다. 2025년 봄 오픈AI의 'o3'가 처음으로 회계사 평균선을 넘었다. 'GPT-5'는 약 69%를 기록했다. 클로드 오퍼스 5를 비롯한 최근 최상위 모델은 만점 또는 그에 가까운 점수를 냈다. 다만 '큐원3.5-122B' 같은 저가형·오픈 웨이트 모델은 여전히 회계사 평균에 못 미쳤다.
의사·사무직 실험서도 같은 흐름 나타나
전문가 집단과 AI를 맞붙인 실험은 회계 분야가 처음이 아니다. 마이크로소프트(MS)는 의학 학술지 뉴잉글랜드저널오브메디신(NEJM)에 실린 난도 높은 증례 304건을 단계별 진단 과제로 바꿔 AI와 의사를 비교한 결과를 2025년 6월 공개했다. MS의 진단 시스템 'MAI-DxO'는 오픈AI o3와 결합했을 때 85.5%의 증례를 정확히 진단했다. 5~20년 경력의 미국·영국 의사 21명의 평균 정확도는 20%였다. 이 실험에서도 의사들은 교과서나 동료, 다른 AI 도구의 도움을 받을 수 없었다. MS 역시 이 시스템이 의사를 대체하려는 것이 아니라 진료를 돕는 도구라고 선을 그었다.

오픈AI가 지난해 9월 공개한 'GDP발(GDPval)'도 비슷한 결과를 내놨다. GDP발은 미국 국내총생산(GDP) 기여도가 큰 9개 산업의 44개 직업에서 뽑은 1320개 과제로 AI와 현업 전문가를 비교한 평가다. 블라인드 평가에서 앤트로픽의 '클로드 오퍼스 4.1'은 결과물의 47.6%가 전문가와 같거나 더 낫다는 평가를 받았다. 'GPT-5'는 38.8%였다. 오픈AI는 최상위 모델이 전문가보다 약 100배 빠르고 저렴하게 과제를 마칠 수 있다고 분석했다. 다만 과제가 지시가 명확한 단발성 작업 위주여서 상호작용이 필요한 실제 업무를 온전히 반영하지 못한다는 한계도 스스로 인정했다.
실제 결산 업무는 아직 절반 수준 그쳐
머코어 연구진은 이번 결과를 회계사가 AI로 대체될 수 있다는 뜻으로 읽어서는 안 된다고 강조했다. 과제가 꼼꼼한 파일 검색과 세밀한 지시 이행처럼 AI가 가장 잘하는 능력을 주로 시험했기 때문이다. 고객과의 소통, 적절한 질문 던지기, 조직 안에서 쌓이는 암묵적 맥락 파악 같은 업무는 측정되지 않았다.
실험 조건도 회계사에게 녹록지 않았다. 과제는 원래 AI 모델의 실수를 끌어내기 위해 만든 것이어서 찾기 어려운 회계 요건들이 서로 맞물려 있었다. 수치 하나만 놓쳐도 점수가 크게 떨어지는 구조였다. 참가자는 물어볼 동료도, 회사에서 쌓은 업무 맥락도 없이 혼자 과제를 풀었다. 과제 출제자 가운데 한 명은 "과제에 숨겨진 함정은 현실적이지만 결과를 좌우한 것은 실험 조건과 채점 방식이었다"고 말했다.
AI가 결산 업무 전체를 맡기에는 아직 이르다는 지표도 있다. 머코어가 미국 핀테크 기업 램프(Ramp)와 함께 만든 APEX-어카운팅 원본 평가는 가상 기업 10곳의 월말 결산 과제 160개로 구성됐다. 불완전한 장부를 바탕으로 판단하고 여러 프로그램을 오가야 하는 과제들이다. 지난 7월 말 공개된 순위표에서 가장 높은 점수를 받은 앤트로픽의 '클로드 페이블 5'도 채점 기준의 56.4%를 충족하는 데 그쳤다. 전체 과제의 58%는 어떤 모델도 8차례 시도 가운데 한 번도 완벽하게 풀지 못했다.
바턴 연구원은 벤치마크 점수가 치솟는데도 미국 경제 통계에서 AI가 생산성 증가에 기여한 몫은 미미하다며 이를 '1조달러짜리 역설'이라고 불렀다. 그는 앞으로 벤치마크가 사람의 일을 AI가 얼마나 잘 따라 하는지보다 비용이나 시간 탓에 사람이 할 수 없던 작업을 측정하는 쪽으로 옮겨갈 것이라고 내다봤다. 바턴 연구원은 "사람에게 시속 60마일로 달리라고 요구하지는 않지만 그 속도로 사람을 실어 나르는 것이 바로 자동차가 생산성을 높이는 방식"이라고 설명했다.