發生了什麼事
根據《韓國先驅報》報道,韓國科學與資訊通訊部公佈了其主權人工智慧基礎模型專案第二階段的詳細分數。 SK Telecom 以 70.6 分排名第一,其次是 Upstage(69.9 分)、LG AI Research Institute(69 分)和 Motif Technologies(65.8 分)。
根據《韓國先驅報》報道,韓國科學資訊通信部於 8 月 27 日公佈了主權人工智慧基礎模型計畫第二階段的詳細成績。報道稱,在第二階段被淘汰的 Motif Technologies 要求他們和其他入圍團隊同意後,該部公佈了結果。消息人士將該項目描述為開發國內基礎模型能力並擴大韓國人工智慧生態系統的努力。詳細的發佈內容列出了該項目的總體結果以及這些分數在請求和同意後公開的情況。
根據《韓國先驅報》報道,SK Telecom 獲得了最高的總分,為 70.6 分(滿分 100 分)。 Upstage 得分為 69.9 分,LG AI 研究院得分為 69 分,Motif Technologies 得分為 65.8 分。評估綜合基準評估40分、專家評估35分、使用者評估25分。用戶部分包括專業用戶和公眾。這些數字描述了用於總體排名的綜合評估,而不是單獨評估某一類別的結果。
該報告稱,基準部分從人工智慧分析智慧指數中抽取了 25 分,從國家資訊社會機構基準中抽取了 15 分。 Motif Technologies 以 11.9 分在 AAII 部分排名第一,領先 Upstage 的 9.4 分、SK Telecom 的 8.8 分和 LG AI Research Institute 的 7.8 分。 《韓國先驅報》稱 NIA 基準測試涵蓋韓語功能和可靠性等七個領域,SK Telecom 得分為 13.4,Upstage 得分為 13.3,其次是 LG AI Research Institute(得分為 12.8)和 Motif Technologies(得分為 12.7)。組成部分數據顯示了基準部分如何在兩個報告來源之間劃分。
為什麼這很重要
結果提供了公眾對韓國如何在全球基準、韓語能力、可靠性、專家判斷和現實可用性方面比較國內人工智慧工作的看法。他們還表明,不同評估方法的總體排名差異很大。
結果很重要,因為它們使政府支持的韓國人工智慧專案的比較比簡單地宣布選定的公司更加具體。 《韓國先驅報》的報導顯示,領導團隊的整體表現並不是每個方面都是第一名。 Motif 在全球基準類別中處於領先地位,LG AI 研究院在專家評估和公眾評估中處於領先地位,而 SK Telecom 在專業用戶評估中處於領先地位。因此,整體結果反映了綜合評估而不是單一基準結果。
這種分佈說明了評估設計如何形成有關人工智慧能力的結論。模型在國際基準上的表現、韓語和可靠性結果、專家評估和實際可用性可能會衡量不同的品質。根據《韓國先驅報》報道,10名來自產學研機構的外部專家參與了專家評審,49名人工智慧新創公司高管參與了專業用戶評審,185名公眾參與了公眾評審。不同的類別和參與者群體有助於解釋為什麼成分結果沒有產生相同的排名。
對於韓國的人工智慧戰略來說,這些分數為決定哪些國內系統在主權人工智慧計畫下受到持續關注提供了基礎。該部告訴《韓國先驅報》,該計畫的目的不僅是對團隊進行排名或淘汰參與者,而是為了鼓勵該國人工智慧生態系統的質的成長和擴展。該目標表明,分數可以用作模型開發和國家能力建設的回饋,而不僅僅是作為競爭表。該報告沒有確定評估的系統是否廣泛可用,它們如何與領先的國際模型進行比較,或者分數是否可以預測操作部署中的效能。這些懸而未決的問題限制了僅從排名中得出的結論。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
Which component of an AI application is the machine-learning model itself?
接下來看什麼
根據《韓國先驅報》報道,該部表示將審查 Motif Technologies 的反對意見,並在 15 天內做出最終決定。接下來的重大進展是審查的結果、專案參與團隊的任何變更以及未來六個月對其評估目標的修訂。
最直接的進展是該部對 Motif Technologies 的反對意見的回應。根據《韓國先驅報》報道,Motif 先前曾對第二階段的結果提出質疑,該部將根據既定程序審查反對意見,預計將在 15 天內做出最終決定。消息人士沒有透露 Motif 正在尋求什麼補救措施,也沒有說明反對意見是否會改變排名或計畫參與者。因此,審查是報告的第二階段結果可能得到官方更新的下一個階段。
據《韓國先驅報》報道,該部還表示,該項目的發展目標將每六個月修訂一次,作為“移動目標”,反映了人工智慧進步的快速步伐。因此,未來的修訂可能會改變基準效能、專家評審和使用者體驗之間的平衡。報告稱,評估標準和方法是在與入圍團隊事先協商後最終確定的,但沒有提供完整的測試問題、模型版本、訓練數據、評分規則或個人評估者評論。這些遺漏為以後的報告或未來的修訂留下了重要的細節。
讀者應該注意這些評估是否轉化為實際公共或商業用途的證據。 《韓國先驅報》的報告提供了分數和參與計數,但它沒有獨立驗證該部門的基礎數據或評估模型本身。它還沒有確定部署承諾、成本、安全測試、計算資源、許可條款或存取條件。這些細節對於判斷該項目是否代表持久的主權人工智慧能力或主要是政府評估活動非常重要。這些分數建立了報告的比較,而實際使用需要評估結果以外的證據。