최신 뉴스
오늘의 주요 소식을 한눈에 정리합니다
#news#이란#AI#미국

원본 기사

New 56% Benchmark in Figure Triggers Critical Generalization Verification Challenge for All Embodied Agents
New 56% Benchmark in Figure Triggers Critical Generalization Verification Challenge for All Embodied Agents
36Kr eu.36kr.com
🕐 2026년 9월 20일 AM 10:12
기사

피규어AI, 가정방문 블라인드 테스트로 로봇 '범용성' 56% 입증

피규어AI가 실제 가정 30곳에서 블라인드 테스트로 휴머노이드 로봇 성공률을 9%에서 56%로 끌어올렸다.
Sun Sep 20 2026

미국 로봇 스타트업 피규어AI(Figure AI)가 지난 8월 샌프란시스코 베이 지역 가정 30곳을 대상으로 실시한 실사용 테스트에서 휴머노이드 로봇의 범용 작업 성공률이 9%에서 56%로 높아졌다고 밝혔다. 그동안 업계 홍보 문구로만 소비돼 온 '범용성'(generalization) 개념을 검증 가능한 수치로 제시했다는 점에서 주목된다.

30개 가정에서 실시한 블라인드 테스트

이번 테스트에서 로봇은 사전에 학습한 적 없는 30개 가정에 투입돼, 집주인 소유의 소파·침대·접이식 작업대 등 낯선 환경 속에서 임무를 수행했다. 평가 방식은 거실 바닥에 흩어진 장난감 10여 개를 바구니에 모두 담기, 수건을 개어 바구니에 넣기, 침구 정리 중 하나를 무작위로 부여받는 방식이었다. 부분 점수는 없으며, 임무를 끝내지 못하거나 사람이 중간에 개입하면 실패로 처리되는 엄격한 기준이 적용됐다.

헬릭스 2.5 탑재 이후 성공률 급등

피규어AI는 9월 17일 로봇 피규어03에 탑재되는 신형 AI 모델 헬릭스 2.5를 공개했다. 이후 진행된 420회 시도 중 237회가 성공해 종합 성공률 56%를 기록했으며, 이는 이전 9%에서 크게 향상된 수치다. 세부적으로는 침구 정리 67%(140회 중 94회), 수건 개기 62%(140회 중 87회), 장난감 정리 40%(140회 중 56회)로 과제별 편차가 뚜렷했다. 30개 가정 모두 동일한 모델 체크포인트를 사용했고 가정별 별도 조정 없이 블라인드로 진행됐다는 점이 핵심이다.

업계에 던지는 검증 기준

그동안 '범용성'은 체화 인공지능(embodied AI) 업계에서 구체적 검증 없이 통용되던 홍보 표현이었다. 피규어AI가 이번에 재현 가능한 벤치마크를 제시하면서, 유니트리·에이지봇 등 중국 휴머노이드 업체를 포함한 경쟁 업체들도 유사한 실증 데이터로 응답해야 하는 압박에 놓이게 됐다. 가정용 로봇 상용화를 둘러싼 경쟁이 마케팅 문구가 아닌 실측 성능 비교 단계로 넘어가고 있음을 보여주는 사례다.

*출처: 36Kr (2026-09-20)*

공유 Facebook X 이메일

관련 기사

📧 뉴스레터 구독

매일 아침 글로벌 뉴스 브리핑을 이메일로 받아보세요.

아직 무료입니다.