Chuyện gì đã xảy ra
Tạp chí Công nghệ MIT báo cáo về khoảng cách hiệu quả dữ liệu giữa trẻ học ngôn ngữ và các mô hình ngôn ngữ lớn được đào tạo trên các bộ sưu tập văn bản khổng lồ. Các nhà nghiên cứu đang sử dụng các cuộc thi mô hình ngôn ngữ dữ liệu nhỏ, cảnh quay từ camera đeo đầu của trẻ em và các bản ghi âm lớn hơn về cuộc sống đầu đời của trẻ em để điều tra xem máy móc nào có thể bị thiếu.
Tạp chí Công nghệ MIT báo cáo rằng trẻ em thường bắt đầu nói những câu đúng ngữ pháp sau khi nghe khoảng 10 triệu từ, với ước tính đạt khoảng 30 triệu ở mức cao nhất. Ngược lại, các mô hình ngôn ngữ lớn hiện đại có thể xử lý hàng nghìn tỷ mã thông báo trong quá trình đào tạo trước. Bài báo mô tả sự khác biệt này là “khoảng cách hiệu quả dữ liệu”: trẻ em học ngôn ngữ từ một luồng trải nghiệm nhỏ, được thể hiện, trong khi các mô hình phụ thuộc vào bộ sưu tập văn bản lớn hơn rất nhiều.
Báo cáo chỉ ra BabyLM, một cuộc thi được tổ chức bởi các nhà nghiên cứu bao gồm Alex Warstadt, Leshem Choshen và những người khác. MIT Technology Review cho biết cuộc thi chính giới hạn các mô hình trong kho ngữ liệu hợp lý về mặt phát triển khoảng 100 triệu từ, với phần dành cho trẻ mới biết đi sử dụng 10 triệu từ. Dữ liệu có thể bao gồm sách truyện, hội thoại, phụ đề phim, Wikipedia và bản ghi lời nói hướng tới trẻ em. Các mô hình được đánh giá bằng các nhiệm vụ ngữ pháp tương tự như các nhiệm vụ được sử dụng trong ngôn ngữ học tâm lý.
Theo MIT Technology Review, cuộc thi đã thách thức giả định rằng việc học theo chương trình giảng dạy—trình bày tài liệu đơn giản trước tài liệu phức tạp—sẽ giúp người mẫu học tập giống trẻ em hơn. Cách tiếp cận này được ưa chuộng ở hiệp đầu tiên nhưng không đạt hiệu quả như mong đợi. Bài báo cho biết hệ thống dẫn đầu năm 2024, GPT-BERT, đã kết hợp dự đoán mã thông báo tiếp theo với mô hình ngôn ngữ đeo mặt nạ và sau khi đào tạo khoảng 100 triệu từ, đã vượt quá Llama 2 70B của Meta trên một điểm chuẩn BabyLM. Báo cáo cũng nhấn mạnh rằng những mô hình này vẫn yếu hơn nhiều so với các hệ thống thương mại hiện tại và không tái tạo được khả năng chung của trẻ.
Bài báo cho biết chỉ riêng văn bản có thể không thể hiện đầy đủ trải nghiệm thời thơ ấu. Dự án SAYCam của Michael Frank ghi lại cuộc sống của ba em bé trong hai giờ một tuần trong khoảng thời gian từ sáu tháng đến hai tuổi rưỡi. Tạp chí Công nghệ MIT cho biết một mô hình được đào tạo trong 61 giờ từ đoạn phim thô này đã học cách xác định các vật thể và liên kết chúng với các từ, nhưng không tạo ra được khả năng của một đứa trẻ hai tuổi. Một dự án mới hơn do Uri Hasson dẫn đầu đã ghi lại 1.000 ngày đầu tiên trong cuộc đời của 17 đứa trẻ, sử dụng máy ảnh và micrô trong khu vực sinh hoạt khoảng 12 giờ mỗi ngày trong hầu hết các ngày. Tập dữ liệu thu được đã được mô tả trong một bản in trước gần đây, nhưng bài viết này không cung cấp đủ thông tin ở đây để đánh giá độc lập các phương pháp hoặc phát hiện của bản in trước đó.
Tạp chí Công nghệ MIT báo cáo rằng các nhà nghiên cứu đang coi việc khám phá tích cực và học tập xã hội là những thành phần còn thiếu bổ sung. Alison Gopnik lập luận rằng trẻ em lựa chọn trải nghiệm, thử nghiệm và tìm kiếm những tác động có thể dự đoán được trên thế giới, trong khi Elizabeth Bonawitz cho rằng trẻ em suy luận về giáo viên và lý do tại sao thông tin được cung cấp. Bài báo cho biết đường đua BabyLM cho phép các mô hình học hỏi thông qua tương tác với các mô hình khác không hoạt động tốt hơn các phương pháp tiêu chuẩn. Các nhà nghiên cứu và cộng tác viên học thuật của Meta cũng đã công bố một tiêu chuẩn và thách thức liên quan đến cảnh quay từ camera đeo đầu trẻ em, mặc dù báo cáo không chứng minh rằng nỗ lực này đã tạo ra một mô hình quy mô trẻ em thành công.
Chi tiết nguồn: technologyreview.com ↗
Tại sao nó quan trọng
Nghiên cứu này có thể ảnh hưởng đến cách đào tạo các mô hình AI, đặc biệt đối với video và ngôn ngữ thiểu số nơi không có bộ dữ liệu lớn. Nó cũng có thể cung cấp các công cụ thử nghiệm mới để nghiên cứu sự phát triển ngôn ngữ, trong khi bài báo nhấn mạnh rằng các mô hình hiện tại vẫn chưa thể tái tạo được những khả năng rộng hơn của trẻ.
MIT Technology Review báo cáo rằng hiệu quả của dữ liệu đã trở thành một hạn chế về mặt kỹ thuật khi các nhà phát triển AI mở rộng mô hình bằng cách tăng dữ liệu đào tạo. Bài báo cho biết các mô hình biên giới có thể đang huấn luyện trước dữ liệu nhiều hơn khoảng 10 lần so với 15 nghìn tỷ mã thông báo được báo cáo của Llama 3.1, trong khi việc cung cấp dữ liệu internet dễ dàng có sẵn cuối cùng có thể bị hạn chế, có thể sớm nhất là vào những năm 2030. Dòng thời gian đó là ước tính dựa trên cuộc thảo luận của bài viết và không được xác nhận độc lập ở đây.
Học tập hiệu quả hơn có thể mở rộng khả năng tiếp cận phát triển AI Báo cáo dẫn lời David Samuel, một trong những kiến trúc sư của GPT-BERT, nói rằng tiếng Séc và tiếng Na Uy có sẵn dữ liệu đào tạo ít hơn nhiều so với tiếng Anh, trong khi các ngôn ngữ như tiếng Sami có thể chỉ có hàng chục triệu mã thông báo. Nếu các mô hình có thể học hiệu quả hơn từ các tập dữ liệu nhỏ, thì các trường đại học và cộng đồng làm việc bằng các ngôn ngữ có nguồn lực hạn chế có thể xây dựng các hệ thống có khả năng cao hơn mà không cần nguồn lực cần thiết cho đào tạo siêu quy mô. Tạp chí Công nghệ MIT trình bày đây là một lợi ích tiềm năng chứ không phải là một kết quả đã được chứng minh.
Nghiên cứu này cũng có thể quan trọng đối với AI đa phương thức. MIT Technology Review báo cáo rằng việc thêm dữ liệu trực quan vào hệ thống BabyLM vẫn chưa mang lại lợi ích như mong đợi, trong khi các mô hình hiện có được đào tạo về cảnh quay dành cho trẻ em chỉ học được các liên kết từ-đối tượng đơn giản. Nếu các nhà nghiên cứu xác định cách trẻ em kết hợp thị giác, thính giác, chuyển động, sự chú ý và ngôn ngữ, thì những phát hiện đó có thể cung cấp thông tin cho các hệ thống được đào tạo về video và dữ liệu giác quan khác. Bài báo không báo cáo một phương pháp đã được chứng minh đã thu hẹp khoảng cách.
Có một giá trị khoa học ngoài hiệu quả của mô hình. Báo cáo mô tả các nhà nghiên cứu sử dụng mô hình ngôn ngữ như những phiên bản thử nghiệm không hoàn hảo cho người dùng ngôn ngữ. Các nhà khoa học có thể áp đặt những điều kiện khó áp dụng hoặc phi đạo đức đối với trẻ em, chẳng hạn như hạn chế tiếp xúc với các dạng ngữ pháp cụ thể hoặc mô phỏng các mức độ song ngữ khác nhau. Tạp chí Công nghệ MIT cho biết những thí nghiệm như vậy có thể kiểm tra ý tưởng về việc liệu ngôn ngữ có phụ thuộc vào cấu trúc bẩm sinh, những hạn chế trong học tập chung hay trải nghiệm môi trường hay không. Những so sánh này vẫn còn hạn chế vì bộ não được thể hiện, phát triển liên tục và chứa đựng những cơ chế sinh học mà các mô hình ngôn ngữ không chia sẻ.
Bằng chứng trung tâm ủng hộ một kết luận hẹp hơn so với tuyên bố rằng AI đang tiếp cận khả năng học tập của con người. MIT Technology Review báo cáo rằng các mô hình có thể học cú pháp và hoạt động tốt trên các điểm chuẩn đã chọn, nhưng cũng cho biết các hệ thống ở quy mô trẻ em vẫn còn cồng kềnh, nhiều mô hình không thể tạo văn bản và các mô hình được đào tạo bằng video hiện tại không còn giống trẻ con nữa. Bài báo không chứng minh rằng bất kỳ kiến trúc hiện tại nào đều học ngôn ngữ với hiệu quả ở cấp độ con người, cũng như không khẳng định rằng những hiểu biết sâu sắc từ các mô hình sẽ giải quyết những tranh chấp lâu dài về ngôn ngữ học hoặc tâm lý học phát triển.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Xem liệu các phương pháp đào tạo đa phương thức, tương tác và mang tính xã hội có cải thiện hiệu suất trên dữ liệu quy mô trẻ em hay không. Đồng thời xem liệu các tập dữ liệu mới như bản ghi dài hạn về cuộc sống của trẻ em có tạo ra những tiến bộ có thể đo lường được hay không và liệu các nhà nghiên cứu có thể phân biệt những hiểu biết sâu sắc về nhận thức hữu ích với sự so sánh giữa các hệ thống cơ bản khác nhau hay không.
Lĩnh vực đầu tiên cần xem xét là liệu các mô hình được đào tạo trên dữ liệu cảm giác phong phú hơn có thể vượt ra ngoài các liên kết từ-đối tượng hay không. MIT Technology Review báo cáo rằng các hệ thống dựa trên SAYCam đã học được những từ đơn giản như “quả bóng” và “mèo” nhưng không trở thành những người sử dụng ngôn ngữ có khả năng sử dụng rộng rãi. Do đó, các đánh giá trong tương lai nên kiểm tra ngữ pháp, nền tảng, khái quát hóa, tương tác và học tập theo thời gian thay vì dựa vào các kết quả nhận dạng riêng lẻ.
Các nhà nghiên cứu cũng sẽ cần xác định xem liệu học tập tích cực có tạo ra những lợi ích có thể đo lường được hay không. Bài báo mô tả trẻ em lựa chọn trải nghiệm, thử nghiệm và tìm kiếm thông tin để lấp đầy lỗ hổng kiến thức, nhưng cho biết các thử nghiệm trên mô hình xã hội ban đầu không đánh bại được các mô hình tiêu chuẩn. Một tiến bộ có ý nghĩa sẽ yêu cầu các so sánh có kiểm soát cho thấy hình thức khám phá hoặc tương tác nào cải thiện việc học trong cùng một giới hạn dữ liệu và tính toán.
Bộ dữ liệu theo chiều dọc có thể thay đổi cơ sở bằng chứng. MIT Technology Review báo cáo rằng dự án của Hasson đã ghi lại 17 đứa trẻ trong 1.000 ngày đầu tiên của chúng, tạo ra cái nhìn sâu sắc hơn về trải nghiệm ban đầu so với các dự án headcam trước đó. Những ẩn số quan trọng bao gồm mức độ đại diện của các gia đình tham gia, cách ghi chú thích, biện pháp bảo vệ quyền riêng tư nào chi phối quyền truy cập và liệu dữ liệu có thể được sử dụng để đào tạo mô hình mà không làm giảm trải nghiệm thời thơ ấu thành một tập hợp hẹp các tín hiệu có thể đo lường được hay không. Nguồn không trả lời những câu hỏi này.
BabyLM và các tiêu chuẩn liên quan phải được tuân thủ về khả năng tái tạo và phạm vi. Bài báo báo cáo một kết quả tốt cho GPT-BERT trên một điểm chuẩn so với Llama 2 70B, nhưng cũng nói rõ rằng điều này không làm cho GPT-BERT nhìn chung có thể so sánh được với một mẫu thương mại hiện đại. Người đọc nên xem liệu kết quả có phù hợp với các ngôn ngữ, tập dữ liệu, kích thước mô hình và nhiệm vụ đánh giá hay không và liệu lợi ích có đến từ các phương pháp học tập thực sự tốt hơn hay từ các lựa chọn thiết kế dành riêng cho điểm chuẩn hay không.
Cuối cùng, những ưu tiên thực tế của lĩnh vực này có thể quyết định liệu nghiên cứu lấy cảm hứng từ trẻ em có lan rộng hay không. MIT Technology Review báo cáo rằng các phòng thí nghiệm tiên phong không chạy đua rộng rãi để sao chép tâm lý học phát triển, trong khi Meta đã thể hiện sự quan tâm đặc biệt đến nghiên cứu video và camera đeo đầu cho trẻ em. Vẫn chưa biết liệu các công ty có công bố đủ phương pháp và kết quả để cho phép giám sát độc lập hay không, liệu các cộng đồng ngôn ngữ nhỏ có được hưởng lợi trực tiếp hay không và liệu những phát hiện về nhận thức bắt nguồn từ mô hình AI có đứng vững được bằng chứng từ các nghiên cứu về sự phát triển và trẻ em thực sự hay không.