Що сталося
The Economic Times повідомляє, що Vahan AI працював із технічною командою Nvidia у рамках програми Nvidia Inception, щоб налаштувати модель Nemotron 3 Nano із 30 мільярдами параметрів для голосової служби підбору кадрів, яка обслуговує синіх комірців і службовців в Індії. Компанія каже, що модель знаходиться у виробництві та обробляє близько 10% трафіку.
The Economic Times повідомляє, що Vahan AI точно налаштував модель Nemotron 3 Nano від Nvidia, яка описана в статті як така, що має 30 мільярдів параметрів, для голосового рекрутера компанії на основі штучного інтелекту. Служба Vahan AI спілкується з професіоналами, які шукають роботу, підбирає їм вакансії та допомагає з частинами процесу найму. У статті йдеться, що компанія працювала з технічною командою Nvidia через програму Inception Nvidia, використовуючи власні дані про наймання Вахана.
The Economic Times повідомляє, що налаштована модель була розгорнута у виробництві та наразі обробляє близько 10% трафіку Vahan AI. Засновник і виконавчий директор Мадхав Крішна сказав виданню, що компанія спостерігає перші позитивні ознаки, але очікує, що з часом вона досягне більшого масштабу. У статті не вказано, скільки дзвінків або користувачів включено до цієї частки трафіку, які регіони чи мови охоплено, або коли компанія очікує розширити розгортання.
Відповідно до заяв, опублікованих The Economic Times, налаштована модель забезпечила майже в 6,7 разів швидший час до першої відповіді та більш ніж у три рази меншу середню наскрізну затримку, ніж система Vahan AI, яку раніше використовував. Компанія заявила, що її попередня система спиралася на готову мовну модель із 120 мільярдами параметрів. Vahan AI також сказав, що перевірив правильність відповідей, відповіді, подібні до людини, відповідність мови, виклик функцій і точність інструкцій, переданих іншим інструментам.
The Economic Times повідомляє, що Vahan AI підготував свої навчальні дані зі сховища розмов із шукачами роботи синіх комірців. Крішна оцінив набір даних приблизно в 20 000-30 000 годин дзвінків. У компанії заявили, що спеціалізоване навчання допомогло системі впоратися з перемиканням мов і регіональними варіаціями в індійському мовленні, включаючи різні способи вираження загальних слів хінді. Vahan AI планує запустити модель на інфраструктурі GPU Nvidia через індійського хмарного постачальника, а також працює з Nvidia над моделями мовлення з відкритим вихідним кодом для інших частин його голосового стеку.
Деталі джерела: m.economictimes.com ↗
Чому це важливо
Розгортання, про яке повідомляється, є конкретним прикладом того, як компанія адаптує меншу мовну модель до вузько визначеної багатомовної голосової програми. Якщо перші результати компанії витримають, спеціалізовані моделі можуть зменшити затримки відповіді та витрати на інфраструктуру в службах, де важливі природна розмова та володіння місцевою мовою.
Повідомлена зміна має значення, оскільки голосові програми чутливі до затримок. The Economic Times цитує Крішну, який описує типову затримку від 500 мілісекунд до однієї секунди як таку, що робить взаємодію неприродною, і каже, що Vahan AI очікує, що налаштована система зменшить цю затримку. Швидші перші відповіді можуть полегшити відстеження автоматичних викликів, але стаття не містить незалежного тестування якості розмови чи задоволеності користувачів.
Цей випадок також показує, чому модель загального призначення може бути не єдиним варіантом для виробничої служби ШІ. Vahan AI каже, що його модель була адаптована до конкретного завдання, конкретної робочої сили та шаблонів багатомовної розмови в Індії. Меншу або більш вузько налаштовану модель потенційно може бути легше використовувати для виконання цього завдання, ніж набагато більшу модель загального призначення, хоча джерело не надає цифр витрат, вимог до апаратного забезпечення, використання енергії або порівняння загальних операційних витрат.
Вербування — це наслідок. Описується, що система допомагає підбирати людей на роботу та підтримує частини процесу найму, тому помилки можуть вплинути на доступ до роботи, інформацію, яку отримують кандидати, або на те, наскільки ефективно вони просуваються в процесі. The Economic Times повідомляє про технічні показники компанії, але не повідомляє про показники демографічної справедливості, рівень помилок за мовами чи регіонами, процедури перевірки персоналом або докази того, що система покращує результати найму.
Повідомлення про використання від 20 000 до 30 000 годин розмов викликають практичні питання щодо згоди, конфіденційності, збереження, анотації та обробки конфіденційної інформації про роботу. Компанія каже, що використання хмарного провайдера в Індії означає, що дані не залишають країну. Це заява, яку приписують Vahan AI, а не незалежна підтверджена оцінка потоків даних системи або засобів контролю відповідності. Джерело також не повідомляє, чи повідомляли шукачам роботу про те, що бесіди можуть використовуватися для навчання моделі.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Що дивитися далі
The Economic Times не перевіряє незалежно результати порівняльного аналізу Vahan AI, практики даних або повідомлені цифри розміщення. Наступні важливі питання полягають у тому, чи модель розширюється за межі початкової частки трафіку, чи зберігається її затримка та підвищення точності в масштабі, як керуються даними про найм персоналу та чи покращує система результати для шукачів роботи, а не лише технічні показники.
Наступна віха, яку можна виміряти, полягає в тому, чи зможе Vahan AI перевищити налаштовану модель понад 10% частки робочого трафіку. Більше впровадження дасть більше доказів надійності в реальних умовах експлуатації, включаючи піковий попит, різні акценти, перемикання кодів і переривання, звичайні для голосових розмов. У статті немає розкладу цього розширення.
Незалежна оцінка допомогла б прояснити претензії компанії. The Economic Times повідомляє про відносне покращення затримки та загальні покращення в еталонних тестах компанії, але не публікує дизайн еталонного тесту, розміри вибірки, базові конфігурації, абсолютну точність, довірчі інтервали чи результати для кожної мови. Порівняння з попередньою системою зі 120 мільярдами параметрів також може залежати від відмінностей в інфраструктурі та конфігурації обслуговування, які не описані.
Управління даними заслуговує на пильну увагу в міру розвитку системи. Повідомляється, що навчальний корпус Vahan AI складається з бесід із шукачами роботи, і компанія каже, що створює додаткові спеціалізовані моделі найму. Суспільно корисна інформація включатиме, як збираються записи та стенограми, чи можуть люди відмовитися, як видаляється особиста інформація, як довго зберігаються дані та який нагляд з боку людини застосовується, коли система впливає на процес найму.
У звіті йдеться, що Vahan AI працює з Nvidia над тонким налаштуванням моделей мовлення з відкритим кодом для інших частин своєї голосової системи. Також йдеться, що компанія має намір використовувати інфраструктуру GPU Nvidia через індійського хмарного провайдера. Залишається невідомим, чи приведуть ці зусилля до ширшого розгортання продукту, зниження витрат, кращих показників розміщення чи просто покращення реагування системи. Джерело незалежно не підтверджує жодного з цих результатів.