Επιστροφή στις Ειδήσεις
ΚαινοτομίαAI Understanding ενημέρωση

Το MIT Technology Review εξετάζει γιατί τα παιδιά μαθαίνουν τη γλώσσα πολύ πιο αποτελεσματικά από τα μοντέλα τεχνητής νοημοσύνης

Το MIT Technology Review αναφέρει ότι τα παιδιά αποκτούν γλώσσα από πολύ λιγότερα δεδομένα από τα μεγάλα γλωσσικά μοντέλα και οι ερευνητές δοκιμάζουν εάν η αισθητηριακή, η διερευνητική και η κοινωνική μάθηση των παιδιών μπορεί να καθοδηγήσει πιο αποτελεσματική τεχνητή νοημοσύνη.

7 min readRead the original reporting
Source-provided image accompanying MIT Technology Review examines why children learn language far more efficiently than AI models
Αναφορά που αποδίδεταιΗ πηγή καταγράφηκε
Εκδότης
technologyreview.com
Σύνδεσμος πηγής
technologyreview.comhttps://www.technologyreview.com/2026/08/24/1141740/kids-machines-language-learning/
Τύπος πηγής
Αναφορά από ειδησεογραφικό μέσο — όχι έγγραφο πρώτου μέρους.

Αυτό που δεν μπορέσαμε να επιβεβαιώσουμε ανεξάρτητα: Αυτός ο ισχυρισμός αποδίδεται στο ονομαζόμενο κατάστημα. Δεν το επαληθεύσαμε με έγγραφο πρώτου μέρους. (technologyreview.com)

ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Γενίκευση
Πόσο καλά αποδίδει ένα μοντέλο σε νέα, αόρατα δεδομένα εκτός του σετ εκπαίδευσης.
Προεκπαίδευση
Αρχική εκπαίδευση μοντέλων μεγάλης κλίμακας σε ευρεία δεδομένα πριν από την κατάντη προσαρμογή.
Σημείο αναφοράς
Μια τυποποιημένη δοκιμή ή σύνολο δεδομένων που χρησιμοποιείται για τη μέτρηση και τη σύγκριση της απόδοσης του μοντέλου.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Το MIT Technology Review αναφέρει το χάσμα απόδοσης δεδομένων μεταξύ των παιδιών που μαθαίνουν γλώσσα και των μεγάλων γλωσσικών μοντέλων που εκπαιδεύονται σε τεράστιες συλλογές κειμένων. Οι ερευνητές χρησιμοποιούν διαγωνισμούς γλωσσικών μοντέλων μικρών δεδομένων, βίντεο με παιδική κάμερα και μεγαλύτερες ηχογραφήσεις της πρώιμης ζωής των παιδιών για να διερευνήσουν τι μηχανήματα μπορεί να λείπουν.

Το MIT Technology Review αναφέρει ότι τα παιδιά συνήθως αρχίζουν να παράγουν γραμματικά σωστές προτάσεις αφού ακούσουν περίπου 10 εκατομμύρια λέξεις, με τις εκτιμήσεις να φτάνουν περίπου τα 30 εκατομμύρια στο υψηλότερο επίπεδο. Αντίθετα, τα σύγχρονα μοντέλα μεγάλων γλωσσών μπορεί να επεξεργάζονται τρισεκατομμύρια μάρκες κατά τη διάρκεια της προεκπαίδευσης. Το άρθρο περιγράφει αυτή τη διαφορά ως το «κενό απόδοσης δεδομένων»: τα παιδιά μαθαίνουν τη γλώσσα από μια μικρή, ενσωματωμένη ροή εμπειρίας, ενώ τα μοντέλα εξαρτώνται από πολύ μεγαλύτερες συλλογές κειμένων.

Η έκθεση επισημαίνει τον BabyLM, έναν διαγωνισμό που διοργανώθηκε από ερευνητές όπως οι Alex Warstadt, Leshem Choshen και άλλοι. Το MIT Technology Review λέει ότι ο κύριος διαγωνισμός περιορίζει τα μοντέλα σε ένα αναπτυξιακά εύλογο σώμα περίπου 100 εκατομμυρίων λέξεων, με ένα κομμάτι σε κλίμακα νηπίων να χρησιμοποιεί 10 εκατομμύρια. Τα δεδομένα μπορεί να περιλαμβάνουν βιβλία παραμυθιών, διαλόγους, υπότιτλους ταινιών, Wikipedia και μεταγραφές ομιλίας που απευθύνονται σε παιδιά. Τα μοντέλα αξιολογούνται με γραμματικές εργασίες παρόμοιες με αυτές που χρησιμοποιούνται στην ψυχογλωσσολογία.

Σύμφωνα με το MIT Technology Review, ο διαγωνισμός αμφισβήτησε την υπόθεση ότι η μάθηση του προγράμματος σπουδών - η παρουσίαση απλού υλικού πριν από σύνθετο υλικό - θα βοηθούσε τα μοντέλα να μάθουν περισσότερα όπως τα παιδιά. Η προσέγγιση ήταν δημοφιλής στον πρώτο γύρο, αλλά δεν απέδωσε όσο αναμενόταν. Το άρθρο λέει ότι το κορυφαίο σύστημα του 2024, GPT-BERT, συνδύασε την επόμενη πρόβλεψη με μοντελοποίηση με μάσκα και, μετά από εκπαίδευση σε περίπου 100 εκατομμύρια λέξεις, ξεπέρασε το Llama 2 70B του Meta σε ένα σημείο αναφοράς BabyLM. Η έκθεση τονίζει επίσης ότι αυτά τα μοντέλα παραμένουν πολύ πιο αδύναμα από τα τρέχοντα εμπορικά συστήματα και δεν αναπαράγουν τις γενικές δυνατότητες ενός παιδιού.

Το άρθρο αναφέρει ότι το κείμενο από μόνο του μπορεί να είναι μια ανεπαρκής προσέγγιση της παιδικής εμπειρίας. Το έργο SAYCam του Michael Frank κατέγραψε δύο ώρες την εβδομάδα από τη ζωή τριών μωρών μεταξύ έξι μηνών και δυόμισι ετών. Το MIT Technology Review λέει ότι ένα μοντέλο που εκπαιδεύτηκε σε 61 ώρες αυτού του ακατέργαστου πλάνα έμαθε να αναγνωρίζει αντικείμενα και να τα συσχετίζει με λέξεις, αλλά δεν παρήγαγε τις ικανότητες ενός παιδιού δύο ετών. Ένα νεότερο έργο με επικεφαλής τον Uri Hasson κατέγραψε τις πρώτες 1.000 ημέρες της ζωής 17 παιδιών, χρησιμοποιώντας κάμερες και μικρόφωνα σε χώρους διαβίωσης για περίπου 12 ώρες την ημέρα τις περισσότερες ημέρες. Το σύνολο δεδομένων που προέκυψε περιγράφηκε σε μια πρόσφατη προεκτύπωση, αλλά το άρθρο δεν παρέχει αρκετές πληροφορίες εδώ για να αξιολογήσει ανεξάρτητα τις μεθόδους ή τα ευρήματα αυτής της προεκτύπωσης.

Το MIT Technology Review αναφέρει ότι οι ερευνητές εξετάζουν την ενεργό εξερεύνηση και την κοινωνική μάθηση ως επιπλέον συστατικά που λείπουν. Η Alison Gopnik υποστηρίζει ότι τα παιδιά επιλέγουν εμπειρίες, πειραματίζονται και αναζητούν προβλέψιμα αποτελέσματα στον κόσμο, ενώ η Elizabeth Bonawitz λέει ότι τα παιδιά σκέφτονται για τους δασκάλους και γιατί παρέχονται πληροφορίες. Το άρθρο λέει ότι ένα κομμάτι BabyLM που επιτρέπει στα μοντέλα να μαθαίνουν μέσω της αλληλεπίδρασης με άλλα μοντέλα δεν ξεπέρασε τις τυπικές προσεγγίσεις. Οι ερευνητές και οι ακαδημαϊκοί συνεργάτες του Meta έχουν επίσης ανακοινώσει ένα σημείο αναφοράς και μια πρόκληση που περιλαμβάνει πλάνα με κάμερα κεφαλής μωρού, αν και η έκθεση δεν αποδεικνύει ότι αυτή η προσπάθεια έχει δημιουργήσει ένα επιτυχημένο μοντέλο παιδικής κλίμακας.

Στοιχεία πηγής: technologyreview.com ↗

Γιατί έχει σημασία

Η έρευνα θα μπορούσε να επηρεάσει τον τρόπο με τον οποίο εκπαιδεύονται τα μοντέλα τεχνητής νοημοσύνης, ειδικά για βίντεο και μειονοτικές γλώσσες όπου δεν είναι διαθέσιμα μεγάλα σύνολα δεδομένων. Μπορεί επίσης να παρέχει νέα πειραματικά εργαλεία για τη μελέτη της γλωσσικής ανάπτυξης, ενώ το άρθρο υπογραμμίζει ότι τα τρέχοντα μοντέλα απέχουν πολύ από το να αναπαράγουν τις ευρύτερες ικανότητες ενός παιδιού.

Το MIT Technology Review αναφέρει ότι η αποτελεσματικότητα των δεδομένων έχει γίνει μηχανικός περιορισμός καθώς οι προγραμματιστές τεχνητής νοημοσύνης κλιμακώνουν μοντέλα αυξάνοντας τα δεδομένα εκπαίδευσης. Το άρθρο λέει ότι τα συνοριακά μοντέλα θα μπορούσαν να εκπαιδεύονται σε περίπου δέκα φορές περισσότερα δεδομένα από τα αναφερόμενα 15 τρισεκατομμύρια token του Llama 3.1, ενώ η παροχή εύκολα διαθέσιμων δεδομένων Διαδικτύου μπορεί τελικά να περιοριστεί, πιθανώς ήδη από τη δεκαετία του 2030. Αυτό το χρονοδιάγραμμα είναι μια εκτίμηση που αποδίδεται στη συζήτηση του άρθρου και δεν επιβεβαιώνεται ανεξάρτητα εδώ.

Η πιο αποτελεσματική μάθηση θα μπορούσε να διευρύνει την πρόσβαση στην ανάπτυξη τεχνητής νοημοσύνης. Η αναφορά αναφέρει τον David Samuel, έναν από τους αρχιτέκτονες του GPT-BERT, ο οποίος είπε ότι τα Τσέχικα και τα Νορβηγικά έχουν πολύ λιγότερα διαθέσιμα εκπαιδευτικά δεδομένα από τα αγγλικά, ενώ γλώσσες όπως το Sami μπορεί να έχουν μόνο δεκάδες εκατομμύρια μάρκες. Εάν τα μοντέλα μπορούσαν να μάθουν πιο αποτελεσματικά από μικρά σύνολα δεδομένων, τα πανεπιστήμια και οι κοινότητες που εργάζονται σε γλώσσες με χαμηλούς πόρους θα μπορούσαν να είναι σε θέση να δημιουργήσουν πιο ικανά συστήματα χωρίς τους πόρους που απαιτούνται για εκπαίδευση σε υπερκλίμακα. Το MIT Technology Review το παρουσιάζει αυτό ως πιθανό όφελος, όχι ως αποδεδειγμένο αποτέλεσμα.

Η έρευνα θα μπορούσε επίσης να έχει σημασία για την πολυτροπική τεχνητή νοημοσύνη. Το MIT Technology Review αναφέρει ότι η προσθήκη οπτικών δεδομένων στα συστήματα BabyLM δεν έχει ακόμη αποφέρει τα αναμενόμενα κέρδη, ενώ τα υπάρχοντα μοντέλα που έχουν εκπαιδευτεί σε παιδικά πλάνα έχουν μάθει μόνο απλούς συσχετισμούς λέξης-αντικειμένου. Εάν οι ερευνητές εντοπίσουν πώς τα παιδιά συνδυάζουν την όραση, την ακοή, την κίνηση, την προσοχή και τη γλώσσα, αυτά τα ευρήματα θα μπορούσαν να ενημερώσουν συστήματα εκπαιδευμένα σε βίντεο και άλλα αισθητηριακά δεδομένα. Το άρθρο δεν αναφέρει μια δοκιμασμένη μέθοδο που έχει ήδη κλείσει το χάσμα.

Υπάρχει μια επιστημονική αξία πέρα ​​από την αποτελεσματικότητα του μοντέλου. Η έκθεση περιγράφει ερευνητές που χρησιμοποιούν γλωσσικά μοντέλα ως ατελή πειραματικά stand-in για τους χρήστες γλωσσών. Οι επιστήμονες μπορούν να επιβάλουν συνθήκες που θα ήταν δύσκολο ή ανήθικο να επιβληθούν στα παιδιά, όπως ο περιορισμός της έκθεσης σε συγκεκριμένες γραμματικές μορφές ή η προσομοίωση διαφορετικών βαθμών διγλωσσίας. Το MIT Technology Review λέει ότι τέτοια πειράματα θα μπορούσαν να δοκιμάσουν ιδέες σχετικά με το εάν η γλώσσα εξαρτάται από την έμφυτη δομή, τους γενικούς περιορισμούς μάθησης ή την περιβαλλοντική εμπειρία. Αυτές οι συγκρίσεις παραμένουν περιορισμένες επειδή οι εγκέφαλοι ενσωματώνονται, αναπτύσσονται συνεχώς και περιέχουν βιολογικούς μηχανισμούς που δεν μοιράζονται τα γλωσσικά μοντέλα.

Τα κεντρικά στοιχεία υποστηρίζουν ένα πιο στενό συμπέρασμα από τους ισχυρισμούς ότι η τεχνητή νοημοσύνη πλησιάζει την ανθρώπινη μάθηση. Το MIT Technology Review αναφέρει ότι τα μοντέλα μπορούν να μάθουν σύνταξη και να αποδίδουν καλά σε επιλεγμένα σημεία αναφοράς, αλλά λέει επίσης ότι τα συστήματα παιδικής κλίμακας παραμένουν αδέξια, πολλά δεν μπορούν να δημιουργήσουν κείμενο και τα τρέχοντα μοντέλα που εκπαιδεύονται σε βίντεο δεν είναι καθόλου παιδικά. Το άρθρο δεν αποδεικνύει ότι οποιαδήποτε υπάρχουσα αρχιτεκτονική μαθαίνει γλώσσα με αποτελεσματικότητα σε ανθρώπινο επίπεδο, ούτε ότι οι γνώσεις από μοντέλα θα επιλύσουν μακροχρόνιες διαφωνίες στη γλωσσολογία ή την αναπτυξιακή ψυχολογία.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Παρακολουθήστε εάν οι πολυτροπικές, διαδραστικές και κοινωνικά ενημερωμένες μέθοδοι εκπαίδευσης βελτιώνουν την απόδοση σε δεδομένα παιδικής κλίμακας. Παρακολουθήστε επίσης εάν νέα σύνολα δεδομένων, όπως μακροπρόθεσμες καταγραφές της ζωής των παιδιών, παράγουν μετρήσιμες προόδους και εάν οι ερευνητές μπορούν να διακρίνουν χρήσιμες γνωστικές ιδέες από συγκρίσεις μεταξύ θεμελιωδώς διαφορετικών συστημάτων.

Ο πρώτος τομέας που πρέπει να παρακολουθήσετε είναι εάν τα μοντέλα που έχουν εκπαιδευτεί σε πλουσιότερα αισθητηριακά δεδομένα μπορούν να προχωρήσουν πέρα ​​από τους συσχετισμούς αντικειμένου-λέξεων. Το MIT Technology Review αναφέρει ότι τα συστήματα που βασίζονται σε SAYCam έμαθαν απλές λέξεις όπως «μπάλα» και «γάτα», αλλά δεν έγιναν ευρέως ικανοί χρήστες γλωσσών. Ως εκ τούτου, οι μελλοντικές αξιολογήσεις θα πρέπει να ελέγχουν τη γραμματική, τη γείωση, τη γενίκευση, την αλληλεπίδραση και τη μάθηση με την πάροδο του χρόνου αντί να βασίζονται σε μεμονωμένα αποτελέσματα αναγνώρισης.

Οι ερευνητές θα πρέπει επίσης να προσδιορίσουν εάν η ενεργός μάθηση παράγει μετρήσιμα κέρδη. Το άρθρο περιγράφει τα παιδιά ότι επιλέγουν εμπειρίες, πειραματίζονται και αναζητούν πληροφορίες που καλύπτουν κενά γνώσης, αλλά λέει ότι τα πρώιμα πειράματα κοινωνικού μοντέλου δεν ξεπέρασαν τα τυπικά μοντέλα. Μια σημαντική πρόοδος θα απαιτούσε ελεγχόμενες συγκρίσεις που να δείχνουν ποιες μορφές εξερεύνησης ή αλληλεπίδρασης βελτιώνουν τη μάθηση κάτω από τα ίδια δεδομένα και τα ίδια όρια υπολογισμού.

Τα διαχρονικά σύνολα δεδομένων μπορεί να αλλάξουν τη βάση αποδεικτικών στοιχείων. Το MIT Technology Review αναφέρει ότι το έργο του Hasson κατέγραψε 17 παιδιά στις πρώτες 1.000 ημέρες τους, δημιουργώντας μια πολύ μεγαλύτερη εικόνα της πρώιμης εμπειρίας από τα προηγούμενα έργα κάμερας κεφαλής. Σημαντικά άγνωστα στοιχεία περιλαμβάνουν το πόσο αντιπροσωπευτικές είναι οι συμμετέχουσες οικογένειες, πώς σχολιάζονται οι ηχογραφήσεις, ποιες διασφαλίσεις απορρήτου διέπουν την πρόσβαση και αν τα δεδομένα μπορούν να χρησιμοποιηθούν για την εκπαίδευση μοντέλων χωρίς να μειωθεί η παιδική εμπειρία σε ένα στενό σύνολο μετρήσιμων σημάτων. Η πηγή δεν απαντά σε αυτές τις ερωτήσεις.

Το BabyLM και τα σχετικά σημεία αναφοράς θα πρέπει να ακολουθούνται για αναπαραγωγιμότητα και εύρος. Το άρθρο αναφέρει ένα ισχυρό αποτέλεσμα για το GPT-BERT σε ένα σημείο αναφοράς έναντι του Llama 2 70B, αλλά επίσης ξεκαθαρίζει ότι αυτό δεν έκανε το GPT-BERT γενικά συγκρίσιμο με ένα σύγχρονο εμπορικό μοντέλο. Οι αναγνώστες θα πρέπει να παρακολουθούν εάν τα αποτελέσματα ισχύουν σε γλώσσες, σύνολα δεδομένων, μεγέθη μοντέλων και εργασίες αξιολόγησης και εάν τα κέρδη προέρχονται από πραγματικά καλύτερες μεθόδους εκμάθησης ή από επιλογές σχεδιασμού που αφορούν συγκεκριμένα σημεία αναφοράς.

Τέλος, οι πρακτικές προτεραιότητες του πεδίου μπορεί να καθορίσουν εάν η έρευνα εμπνευσμένη από παιδιά θα εξαπλωθεί. Το MIT Technology Review αναφέρει ότι τα συνοριακά εργαστήρια δεν αγωνίζονται ευρέως για να αντιγράψουν την αναπτυξιακή ψυχολογία, ενώ ο Meta έχει δείξει ιδιαίτερο ενδιαφέρον για την έρευνα βίντεο και παιδικής κάμερας. Παραμένει άγνωστο εάν οι εταιρείες θα δημοσιεύσουν αρκετές μεθόδους και αποτελέσματα για να επιτρέψουν τον ανεξάρτητο έλεγχο, εάν οι μικρές γλωσσικές κοινότητες θα ωφεληθούν άμεσα και εάν τα γνωστικά ευρήματα που προέρχονται από μοντέλα AI θα αντέξουν στοιχεία από πραγματικά παιδιά και αναπτυξιακές μελέτες.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΕκπαίδευση AIChatGPT και LLMΤο μέλλον του AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;