دليل الذكاء الاصطناعي المرئي

حقول بلينوكسيلز وفوكسيل راديانس

أظهر Plenoxels أنه يمكنك إعادة بناء مشهد ثلاثي الأبعاد بنتائج بجودة NeRF دون أي شبكة عصبية على الإطلاق - مجرد شبكة من وحدات voxels تخزن اللون والكثافة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

The result trains roughly 100x faster than the original NeRF while matching its visual quality.

الغوص العميق

يحقق NeRF الواقعية ولكنه بطيء لأن كل عينة تتطلب تمريرًا للأمام عبر شبكة عصبية عميقة، ويمكن أن يستغرق التدريب ساعات أو أيامًا. طرح بلينوكسيلز (Sara Fridovich-Keil، Alex Yu et al.، 2022) سؤالًا استفزازيًا: هل الشبكة ضرورية أصلاً؟ وكانت إجابتهم لا. إنهم يمثلون المشهد كشبكة فوكسل ثلاثية الأبعاد متفرقة. يخزن كل فوكسل مشغول قيمة عتامة واحدة بالإضافة إلى معاملات توافقية كروية تقوم بتشفير اللون المعتمد على العرض. ولعرض بكسل، يقوم النظام بإدخال هذه القيم بشكل ثلاثي على طول الشعاع ويقوم بتركيبها باستخدام عرض الحجم القياسي. نظرًا لعدم وجود شبكة، تم تحسين الأمر برمته مباشرةً من خلال نزول متدرج على قيم فوكسل، وضبطه من أجل السلاسة. النتيجة الرئيسية: جودة مماثلة لـ NeRF، تم تدريبها في دقائق على وحدة معالجة رسومات واحدة.

البصيرة الفنية

اللون المعتمد على العرض هو الجزء الذكي. بدلاً من إخراج شبكة RGB لكل زاوية عرض، يقوم كل فوكسل بتخزين مجموعة صغيرة من معاملات التوافقيات الكروية (SH) لكل قناة لون. يؤدي تقييم أساس SH في اتجاه الشعاع إلى إعادة بناء كيفية تغير لون تلك النقطة مع وجهة النظر - مما يؤدي إلى التقاط الضوء والانعكاسات المرآوية. العتامة مستقلة عن الاتجاه. الاستيفاء ثلاثي الخطوط القابل للتمييز بالإضافة إلى عرض الحجم يجعل كل قيمة فوكسل قابلة للتدريب مباشرة، لذا فإن التحسين يكون ملائمًا بشكل مباشر وخالي من الشبكة على نمط المربعات الصغرى.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل بلينوكسيلز وحقول إشعاع فوكسل

أثبت بلينوكسيلز أن التمثيل، وليس الشبكة العصبية، هو الذي يحرك جودة NeRF، وهو اكتشاف أعاد تشكيل المجال. لقد ألهمت بشكل مباشر أساليب صريحة ومختلطة مثل شبكات التجزئة الخاصة بـ Instant-NGP، وفي النهاية، 3D Gaussian Splatting، التي تهيمن الآن على عرض التألق في الوقت الفعلي. توقع استمرار الحركة نحو البدائيات الصريحة والصديقة لوحدة معالجة الرسومات والتي يتم تدريبها في ثوانٍ وعرضها في الوقت الفعلي، مع استخدام الشبكات العصبية بشكل انتقائي بدلاً من استخدامها كمخزن للمشهد الأساسي.

التنفيذ في العالم الحقيقي

إعادة بناء الكائن الذي تم التقاطه بسرعة وتحويله إلى أصل ثلاثي الأبعاد في دقائق معدودة للتجارة الإلكترونية أو رقمنة المتحف، بدلاً من ساعات الانتظار.

النماذج الأولية السريعة لتوليف الرؤية الجديدة على وحدة معالجة الرسومات للمستهلك الواحد للبحث والتعليم.

إنشاء مشاهد فوكسل واضحة وقابلة للتحرير يمكن للفنانين فحصها وتهذيبها مباشرة، على عكس أوزان الشبكة غير الشفافة.

بمثابة مثال تعليمي على أن تمثيل المشهد، وليس التعلم العميق، هو ما ينتج نتائج واقعية.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Plenoxels and Voxel Radiance Fields quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

مجالات الإشعاع العصبي

الأسئلة المتداولة

What is Plenoxels and Voxel Radiance Fields?

أظهر Plenoxels أنه يمكنك إعادة بناء مشهد ثلاثي الأبعاد بنتائج بجودة NeRF دون أي شبكة عصبية على الإطلاق - مجرد شبكة من وحدات voxels تخزن اللون والكثافة. والنتيجة هي أن التدريب أسرع بنحو 100 مرة من NeRF الأصلي مع مطابقة الجودة البصرية.

ما هو خيار التصميم الأكثر إثارة للدهشة في Plenoxels مقارنة بـ NeRF؟

يقوم Plenoxels بتخزين المشهد مباشرة في شبكة فوكسل وتحسين تلك القيم، مع عدم وجود شبكة عصبية في المسار.

ما الذي يخزنه كل فوكسل مشغول في Plenoxels لالتقاط الألوان المعتمدة على العرض؟

يحمل كل فوكسل عتامة بالإضافة إلى معاملات توافقية كروية لكل قناة لون، والتي تشفر كيفية تغير اللون مع اتجاه العرض.

ما مدى سرعة تدريب Plenoxels تقريبًا مقارنة بـ NeRF الأصلي؟

من خلال التخلص من تمريرات الشبكة لكل عينة، تم تدريب Plenoxels بمعدل أسرع 100 مرة، وانتهى الأمر في دقائق.

كيف يتم جلب القيم من شبكة فوكسل على طول الشعاع؟

يستخدم Plenoxels استيفاء ثلاثي الخطوط قابل للتمييز لقراءة اللون والعتامة بسلاسة بين مراكز فوكسل.

ما هو الاستنتاج الأوسع الذي أظهره بلينوكسيلز في الميدان؟

من خلال مطابقة جودة NeRF مع عدم وجود شبكة، أظهر Plenoxels أن التمثيل والتحسين، وليس MLP، هما المسؤولان عن النتائج.