개요
그들은 움직임의 원인을 시뮬레이션하지 않고 움직임의 모습을 모방합니다. 이것이 바로 물체가 사라지고, 액체가 이상하게 행동하고, 팔다리가 물체를 통과하고, 클립이 짧게 유지되는 이유입니다. 이는 영상이 실제인지 판단하거나 이러한 모델을 계획 및 로봇 공학에 사용하려는 모든 사람에게 중요합니다.
심층 분석
비디오 생성기는 프레임을 예측하거나 노이즈를 제거하기 위해 방대한 영상 컬렉션에 대해 교육을 받았습니다. 훈련 목표는 실제 비디오와 유사한 출력을 보상합니다. 질량이나 운동량 보존을 따르는 출력에는 보상하지 않습니다. 공이 떨어지거나 사람이 걷는 것과 같은 일반적인 물리학은 데이터에 잘 표현되어 있으며 일반적으로 올바르게 보입니다. 유리 깨짐, 특정한 충돌, 이상한 모양의 용기에 액체가 쏟아지는 등 드물거나 복잡한 사건은 덜 자주 나타나며 학습하기가 더 어렵습니다. Sora에 대한 OpenAI의 자체 기술 자료에서는 유리 깨짐과 같은 상호 작용을 정확하게 모델링하지 못했다고 지적했습니다. 객체 영속성은 기억 문제입니다. 무언가가 숨겨져 있으면 모델은 그것이 보이지 않는 프레임을 통해 그 아이덴티티를 전달해야 합니다. 모델은 제한된 양의 컨텍스트에 참석하므로 숨겨진 개체가 변경된 상태로 다시 나타날 수도 있고 전혀 나타나지 않을 수도 있습니다. 원인과 결과도 약합니다. 물기, 쏟음 또는 찌그러짐은 지속적인 변화를 남겨야 하지만 모델은 이를 일시적인 시각적 이벤트로 처리할 수 있습니다. 클립 길이는 주로 계산에 따라 제한됩니다. 영상은 시공간 토큰으로 표현되며, 토큰 수가 증가함에 따라 주의 비용이 가파르게 상승하므로 많은 제품이 몇 분이 아닌 몇 초를 생성합니다. 긴 비디오는 클립을 확장하여 제작되는 경우가 많으며 이로 인해 오류가 가중됩니다. 일반적인 오해는 이러한 모델에 물리 엔진이 포함되어 있다는 것입니다. 그들은 암묵적인 물리적 규칙성을 발견할 수 있지만 그렇지 않습니다. 연구원들은 이를 테스트하기 위해 Physics-IQ와 같은 벤치마크를 구축했으며 시각적으로 사실적인 출력이 물리적 이해를 의미하지 않는다는 것을 발견했습니다. 세계 모델 연구는 격차를 줄이려고 노력합니다. Google DeepMind의 Genie 라인은 대화형 환경을 생성하고, Meta의 V-JEPA는 픽셀 대신 추상적 표현 공간에서 예측을 통해 학습하며, NVIDIA의 Cosmos는 로봇 공학과 같은 물리적 AI를 대상으로 합니다.
전략적 영향
속도와 규모
Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.
빌드 선택
크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.
팀과 워크플로우
이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.
AI 비디오가 물리학을 잘못하는 이유의 미래
물리적 타당성은 규모와 더 나은 데이터로 향상되었으며 일반적인 장면에서는 계속 향상될 가능성이 높습니다. 긴 지평선의 원인과 결과, 드문 상호 작용, 긴 폐색 전반에 걸쳐 신뢰할 수 있는 개체 영속성과 같은 더 어려운 경우에는 규모만 확장하기보다는 명시적 메모리, 3D 구조 또는 하이브리드 시뮬레이션과 같은 아키텍처 변경이 필요할 수 있습니다. 로봇 공학 및 인터랙티브 환경을 목표로 하는 월드 모델은 활발한 연구 분야이며, 시각적 사실성과 물리적 정확성을 별도로 테스트하는 벤치마크는 실질적인 진전을 보여주는 데 도움이 될 것입니다. 순수 비디오 예측이 강력한 물리학을 학습할 수 있는지 여부는 아직 확정되지 않았으며 연구자들은 이에 대해 의견이 일치하지 않습니다.
실제 구현
생성된 사람이 쿠키를 물었지만, 이후에는 쿠키에 물린 자국이 없습니다. OpenAI는 2024년 모델을 미리 선보일 때 이런 종류의 실패를 Sora의 한계 중 하나로 꼽았습니다.
개가 나무 뒤를 걷고 다른 털 패턴으로 반대편으로 나오는 이유는 모델이 숨겨진 물체에 대한 안정적인 기억을 유지하지 못했기 때문입니다.
주자의 다리는 보폭 중간에 측면을 바꾸는 것처럼 보이고 발은 지면을 따라 미끄러지는 것처럼 보입니다. 이는 모델이 관련된 접촉력이 아니라 달리는 모습을 학습했음을 보여줍니다.
농구공이 림을 통과하고 잠시 사라졌다가 선수의 손에 다시 나타나는데, 이 시퀀스는 프레임마다 매끄럽게 보이지만 물리적인 의미는 없습니다.
위험 및 가드레일
출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.
모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.
신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.
구현 로드맵
정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.
실제 생산 조건과 일치하는 데이터로 테스트합니다.
신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.
모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Why AI Video Gets Physics Wrong quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
자주 묻는 질문
AI 비디오가 물리학적으로 잘못된 이유는 무엇입니까?
AI 비디오는 생성기가 질량, 힘 및 충돌의 규칙이 아니라 시간이 지남에 따라 픽셀이 일반적으로 어떻게 변하는지에 대한 통계적 패턴을 학습하기 때문에 물리학적으로 잘못된 결과를 가져옵니다. 그들은 움직임의 원인을 시뮬레이션하지 않고 움직임의 모습을 모방합니다. 이것이 바로 물체가 사라지고, 액체가 이상하게 행동하고, 팔다리가 물체를 통과하고, 클립이 짧게 유지되는 이유입니다. 이는 영상이 실제인지 판단하거나 이러한 모델을 계획 및 로봇 공학에 사용하려는 모든 사람에게 중요합니다.
일반적인 비디오 생성기의 훈련 목표는 주로 무엇을 보상합니까?
모델은 프레임을 예측하거나 노이즈를 제거하도록 훈련되어 출력이 훈련 영상과 유사하게 보입니다. 물리적 정확성은 직접적으로 측정되지 않습니다.
유리가 깨지는 등의 드문 사건이 비디오 모델에게 특히 어려운 이유는 무엇입니까?
데이터에서 흔하지 않고 물리적으로 복잡한 이벤트는 모델에서 학습할 수 있는 예가 적기 때문에 결과의 신뢰성이 떨어집니다.
가이드에서는 객체 영속성 실패를 주로 어떤 종류의 문제로 설명합니까?
숨겨진 개체의 일관성을 유지하려면 모델은 보이지 않는 프레임을 통해 정체성을 전달해야 하며 제한된 상황으로 인해 이를 신뢰할 수 없습니다.
AI 비디오 클립의 길이가 종종 몇 초에 불과한 주된 이유는 무엇입니까?
더 많은 프레임은 더 많은 토큰을 의미하며 토큰 수에 따라 주의 비용이 빠르게 증가하므로 길이는 컴퓨팅에 의해 제한됩니다.
다음 중 비디오 생성기에 대한 오해를 나타내는 설명은 무엇입니까?
비디오 생성기에는 명시적인 물리 시뮬레이터가 없습니다. 그들이 보여주는 모든 물리학은 학습된 패턴에 내재되어 있습니다.
계속 학습하세요
관련 가이드
이 주제에 대해 선택된 추가 가이드