무슨 일이 일어났나요?
MIT Technology Review는 AI 모델이 어떻게 추론하는지 조사하는 7가지 퍼즐을 기반으로 구축된 대화형 기능을 발표했습니다. 기사에서는 모델이 일부 작업에서 빠르게 개선되었지만 여전히 공간 조작, 익숙한 문제의 미묘한 변형, 시각적 추상화 및 점점 더 복잡해지는 다단계 추론에 어려움을 겪고 있다고 보고합니다.
MIT Technology Review는 이 기능이 공간 추론, 기억 및 적응성, 추상 및 시각적 추론, 인간 직관 및 복잡성 증가를 다루는 7가지 테스트를 제공한다고 보고합니다. 이 기사는 AI 평가의 오랜 역사 속에서 퍼즐 풀이를 다루며, 이 분야 초창기부터 체커, 체스, 바둑과 같은 게임이 테스트베드로 사용되어 왔다는 점을 지적했습니다. 퍼즐 성능이 크게 향상되었다고 합니다. 컬럼비아 대학교 팀은 2024년 후반에 주요 모델이 New York Times Connections 퍼즐의 18%만 해결한 반면, 2025년 초까지 일부 모델은 매번 거의 완벽하게 문제를 해결할 수 있다는 사실을 발견했습니다. 소스는 모델을 식별하거나 기능의 예에 대한 표준화된 비교를 제공하지 않습니다.
MIT Technology Review에서는 공간 추론이 여전히 큰 약점으로 남아 있다고 말합니다. 정신 회전 섹션에서는 독자들에게 다른 각도에서 본 3차원 물체를 식별하도록 요구하고 있으며, 기사에서는 시각적 입력 기능을 갖춘 언어 모델이 여전히 그러한 작업에서 매우 저조한 성능을 보인다고 보고합니다. 이 기능은 이러한 어려움을 AI 시스템이 세계 모델을 개발한다는 주장과 연결하며, 현재의 대규모 언어 모델은 인간 공간 전문가가 할 수 있는 것과 같은 방식으로 3차원 개체를 조작하는 것으로 보이지 않는다고 주장합니다. 이 기사는 또한 기억력과 적응성 문제에 대해서도 설명합니다. 즉, 많은 양의 정보에 대해 훈련된 모델은 익숙한 퍼즐 패턴을 인식하고 작은 변화를 간과할 수 있습니다. 이러한 우려에 대한 증거로 Knights and Knaves 퍼즐의 변형을 포함하는 2024년 Google와 일리노이 대학교 Urbana-Champaign 연구를 인용합니다.
그런 다음 이 기능은 2차원 추상화 및 시각적 추론으로 전환됩니다. MIT Technology Review에서는 그리드가 이미지가 아닌 셀 색상을 인코딩하는 숫자 문자열로 제공될 때 모델이 ARC-AGI 퍼즐에서 더 나은 성능을 발휘한다고 보고합니다. 또한 연구에 따르면 모델은 때때로 복잡하고 일반화할 수 없는 규칙을 통해 정답에 도달할 수 있는 반면 인간은 더 단순한 시각적 개념에 의존할 수 있다는 사실이 밝혀졌습니다. 이 기사에서는 이러한 차이점을 드러낼 수 있는 작업의 예로 SimpleBench 질문, Knights and Knaves 문제, ARC-AGI 변환 퍼즐을 제시합니다.
이는 사람들이 종종 신속하지만 잘못된 답변을 제공하는 반면 모델은 보다 신중하게 반응할 수 있는 직관 테스트를 별도로 설명합니다. 한 가지 예는 박쥐 개체수가 매일 두 배로 늘어날 때 동굴이 절반으로 채워지는 데 시간이 얼마나 걸리는지 묻는 것입니다. 또 다른 사람은 독자들에게 Alice와 관련된 인용문을 확인하도록 요청합니다.
마지막으로 MIT Technology Review에서는 문제가 더욱 복잡해짐에 따라 성능이 저하되는 경우가 많다고 보고합니다. 이는 언어 모델이 하노이 타워의 간단한 버전과 강 건너기 문제를 해결할 수 있지만 디스크 또는 사람의 수가 6개 이상에 도달하면 흔들리기 시작했다는 Apple 연구를 인용합니다. 또한 워싱턴 대학교, 스탠포드 대학교, Allen Institute의 연구원들이 논리 그리드 퍼즐에서 유사한 어려움을 발견한 연구를 인용합니다. 이 기사에서는 논평자들이 이러한 결과가 기계와 같은 고유한 추론 한계를 드러내는지 아니면 단순히 사람들이 복잡성이 증가함에 따라 더 많은 오류를 범한다는 사실을 반영하는지 의문을 제기했다고 지적합니다. 따라서 강 건너기 및 논리 그리드 예제는 모델이 답을 생성할 수 있는지 여부뿐만 아니라 여러 연결된 추론에서 제약 조건을 유지할 수 있는지 여부를 테스트합니다.
소스 세부정보: technologyreview.com ↗
왜 중요한가요?
이 기능은 AI 지능에 대한 광범위한 주장이 오해의 소지가 있는 이유를 보여줍니다. 모델은 사소한 단어 변경, 시각적 변환 또는 여러 종속 단계가 필요한 문제에서 실패하는 반면 상식이나 친숙한 벤치마크에서는 잘 수행될 수 있습니다. 이러한 차이점은 시연이 아닌 결정을 위해 시스템을 사용할 때 중요합니다.
핵심 교훈은 한 가지 테스트 클래스의 성능을 지능의 일반적인 척도로 취급해서는 안 된다는 것입니다. MIT Technology Review의 예는 표면적으로 단순해 보이지만 다양한 기능이 필요한 작업을 포괄합니다. 즉, 정신적으로 개체 회전하기, 진술 전체에서 진실과 거짓 추적하기, 시각적 규칙 추론하기, 오해의 소지가 있는 직관에 저항하기, 제약 조건 하에서 시퀀스 계획하기 등이 있습니다. 시스템은 한 영역에서는 매우 강력하지만 다른 영역에서는 신뢰할 수 없을 수 있습니다. 이러한 불균일성은 사용자가 모델이 근본적인 문제를 이해했다는 증거로 유창한 답변을 해석할 때 특히 관련이 있습니다.
이 기사는 또한 평가 문제를 강조합니다. 즉, 작업 형식이 결과에 실질적인 영향을 미칠 수 있다는 것입니다. MIT Technology Review에서는 시각적 그리드를 수치 표현으로 변환하면 ARC-AGI 성능이 향상된다고 보고합니다. 이는 점수가 모델의 추론 능력뿐만 아니라 문제가 인코딩되고 제시되는 방식도 반영할 수 있음을 시사합니다. 익숙한 퍼즐에도 동일한 우려가 적용됩니다. 모델이 훈련 중에 유사한 변형을 만난 경우 정답은 새로운 사례에 규칙을 적용하는 능력보다는 패턴 인식 또는 검색을 반영할 수 있습니다. 소스는 배포된 시스템에서 두 메커니즘 중 하나가 얼마나 자주 발생하는지 설정하지 않습니다.
이러한 제한은 교육, 소프트웨어, 연구, 행정 또는 익숙하지 않은 사례와 관련된 기타 설정에서 AI를 사용하는 모든 사람에게 실질적인 영향을 미칩니다. 일상적인 예에서 성공한 모델은 문구가 변경되거나 여러 제약 조건이 상호 작용하거나 관련 정보가 텍스트가 아닌 시각적인 경우 여전히 실패할 수 있습니다. 이 기능은 신제품 출시, 새로운 모델 출시 또는 특정 상용 시스템에 대한 통제된 평가를 보고하지 않습니다. 그 가치는 설명적입니다. 독자들에게 벤치마크 이득과 세련된 언어가 그 자체로 강력한 추론을 확립하지 못하는 이유를 확인할 수 있는 구체적인 방법을 제공합니다. 이 기사는 또한 중요한 자격 요건을 유지합니다. 인간은 자신만의 편견을 갖고 있으며 일부 문제에서는 속도가 느리거나 신뢰도가 떨어질 수 있습니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
Which component of an AI application is the machine-learning model itself?
다음에 무엇을 볼 것인가
향후 평가에서는 헤드라인 점수 이상의 테스트를 수행해야 합니다. 중요한 질문에는 모델이 익숙하지 않은 문제를 일반화할 수 있는지, 모델의 답변이 정보가 표현되는 방식에 따라 달라지는지, 복잡성이 증가함에 따라 성능이 어떻게 변화하는지, 성공이 재사용 가능한 전략이나 기억된 패턴을 반영하는지 여부 등이 포함됩니다.
다음으로 유용한 개발은 모델과 작업 형식에 걸쳐 더 광범위하고 재현 가능한 테스트가 될 것입니다. MIT Technology Review의 기능은 7개 테스트 모두를 포괄하는 단일 스코어카드를 제공하지 않으며 소스에서도 대부분의 예에 대한 모델 이름, 버전, 샘플 크기, 프롬프트 조건 또는 오류율을 지정하지 않습니다. 보고된 약점이 널리 퍼져 있는지, 특정 모델 계열에 집중되어 있는지, 테스트 관리 방법에 민감한지 여부를 결정하려면 이러한 세부 정보가 필요합니다.
독립적인 평가는 또한 표현을 변경하면서 기본 퍼즐을 일정하게 유지함으로써 시각적 인식 실패와 추론 실패를 분리해야 합니다. 연구원과 평가자는 또한 진정한 일반화를 통해 모델이 개선되는지, 아니면 벤치마크와 유사한 자료에 더 많이 노출되어 모델이 개선되는지 관찰해야 합니다. Connections 퍼즐과 Knights and Knaves 변형에 대한 기사의 논의는 오염과 친숙함이 중요한 이유를 보여줍니다. 게시된 질문이나 밀접하게 관련된 질문에 대해 잘 수행되는 모델은 동일한 기본 구조로 새로 생성된 문제에 대해서는 동등하게 기능하지 못할 수 있습니다. 따라서 테스트에는 제시된 퍼즐, 변경된 문구, 익숙하지 않은 시각적 레이아웃 및 설득력 있는 답변이 정확하다고 가정하지 않고 중간 제약 조건을 설명하거나 확인해야 하는 작업이 포함되어야 합니다.
복잡성과 실제 전송은 여전히 미해결 문제로 남아 있습니다. MIT Technology Review는 요소 수 또는 필요한 단계가 증가함에 따라 성능이 저하될 수 있다고 보고하지만 소스에서는 이러한 결과가 도구, 검색, 외부 메모리 또는 인간 감독을 통해 실제 시스템으로 변환되는 방법을 확립하지 않았습니다. 향후 보고에서는 이러한 추가 사항이 신뢰성을 향상하는지, 단지 모델이 더 효과적으로 검색하도록 돕는지, 아니면 새로운 실패 모드를 도입하는지 추적해야 합니다. 독자들은 최종 답변뿐만 아니라 전략의 품질을 측정하는 평가도 주의 깊게 살펴봐야 합니다. 취약하거나 일반화할 수 없는 규칙을 통해 도달한 올바른 결과는 문제의 작은 변화에서 살아남지 못할 수 있기 때문입니다.