Apa yang berlaku
Ars Technica melaporkan bahawa IBM telah melancarkan Granite 4.2, versi terkini keluarga model bahasa besar berat terbuka yang bertujuan untuk muat turun dan pengehosan sendiri. Keluaran ini termasuk varian parameter 3B, 8B dan 30B, semuanya menggunakan seni bina penyahkod sahaja dan menawarkan tetingkap konteks 128,000 token asli. Model 8B dan 30B menerima peringkat pembelajaran pengukuhan agenik tambahan untuk tugas seperti menggunakan terminal, mencari di web dan bekerja dengan alatan luaran. Model 3B juga menyokong alat, tetapi Ars Technica mengatakan ia tidak menerima latihan khusus yang sama. IBM menerangkan Granite 4.2 sebagai keluaran berfokuskan penaakulan bagi keluarga.
Ars Technica melaporkan bahawa IBM telah melancarkan Granite 4.2 sebagai keluaran terbaru dalam keluarga model bahasa besar berat terbukanya. Model tersebut direka bentuk untuk dimuat turun dan dihoskan sendiri, meletakkan keluaran dalam pasaran tempatan-LLM dan bukannya mempersembahkannya terutamanya sebagai perkhidmatan API yang dihoskan. Artikel itu mengenal pasti tiga varian: parameter 3B, 8B dan 30B. Ia menerangkan ketiga-tiganya sebagai model penyahkod sahaja, perincian yang membezakan seni bina mereka tetapi tidak, dengan sendirinya, menentukan cara ia akan berprestasi dalam aplikasi tertentu.
Menurut Ars Technica, setiap varian Granite 4.2 mempunyai tetingkap konteks asli sebanyak 128,000 token. Tetingkap konteks menentukan jumlah input dan perbualan atau bahan terdahulu yang boleh diproses oleh model dalam satu interaksi, tetapi sumber tidak melaporkan prestasi model semasa tetingkap itu berkembang atau perkakasan yang diperlukan untuk menggunakannya. Oleh itu, spesifikasi 128,000 token ialah keupayaan produk yang dinyatakan, bukan bukti kualiti, kelajuan atau hasil kos tertentu.
Perubahan produk utama ialah latihan yang digunakan untuk model yang lebih besar. Ars Technica berkata versi 8B dan 30B telah melalui blok pembelajaran pengukuhan agen yang bertujuan untuk mengembangkan keupayaan seperti penggunaan terminal, carian web dan interaksi dengan alatan luaran. Model 3B menyokong alatan juga, tetapi tanpa tahap latihan khusus yang sama. Sumber tidak menerangkan data latihan, prosedur penilaian, kadar kejayaan atau perlindungan untuk interaksi alat tersebut.
IBM mencirikan Granite 4.2 sebagai keluaran berfokuskan penaakulan bagi keluarga Granit, huraian yang dipetik oleh Ars Technica. Artikel itu menerangkan bahawa "penaakulan" dalam tetapan ini merujuk kepada tingkah laku berfungsi seperti membawa hasil perantaraan melalui pelbagai langkah, dan bukannya pemahaman sedar yang setanding dengan penaakulan manusia. Ars Technica berkata pendekatan ini boleh menghasilkan jawapan yang lebih ketat atau tepat dalam beberapa kes, di samping meningkatkan masa tindak balas dan mengira permintaan. Artikel itu termasuk gambar yang diberi kapsyen semasa pengarang menarik Granite 4.2 8B melalui Ollama pada macOS, tetapi imej itu bukan ujian prestasi bebas.
Butiran sumber: arstechnica.com ↗
Mengapa ia penting
Granite 4.2 tiba ketika pembangun dan organisasi meneroka model yang dikendalikan secara tempatan di tengah-tengah kebimbangan mengenai kos dan permintaan pengkomputeran sistem awan sempadan. Ars Technica menerangkan penekanan IBM sebagai penggunaan perusahaan yang boleh diramal, di samping daya tarikan praktikal model yang boleh dihoskan sendiri dan digunakan tanpa yuran API per-token. Keluaran ini juga mencerminkan peralihan yang lebih luas ke arah model yang bertujuan untuk melaksanakan kerja berbantukan pelbagai langkah dan bukan hanya menjana teks. Itu mungkin menjadikan varian Granit yang lebih besar relevan kepada pembangun yang membina ejen tempatan, walaupun sumber itu tidak memberikan bukti penanda aras bebas yang menunjukkan cara ia dibandingkan dengan model lain.
Ars Technica meletakkan keluaran dalam minat yang semakin meningkat dalam model bahasa tempatan. Artikel itu mengatakan pemaju dan perusahaan telah meneroka model yang dikendalikan secara tempatan sebagai alternatif yang berpotensi lebih murah kepada sistem awan sempadan daripada syarikat seperti Anthropic dan OpenAI, di tengah-tengah perbincangan tentang kos model awan dan kekangan pengkomputeran. Sumber itu tidak mengukur penjimatan tersebut, dan ia tidak mendakwa bahawa Granite 4.2 akan lebih murah dalam setiap penggunaan. Kepentingannya ialah IBM menawarkan satu lagi pilihan berwajaran terbuka untuk organisasi yang ingin menjalankan model itu sendiri.
Pengehosan sendiri boleh mengubah ekonomi praktikal percubaan dan penggunaan. Ars Technica menyatakan bahawa model yang dikendalikan secara tempatan boleh digunakan tanpa yuran API per-token, yang membantu menjelaskan daya tarikan mereka kepada penggemar, penyelidik dan pembangun individu yang ingin meninjau perkakasan tempatan. Artikel itu tidak menetapkan perkakasan yang diperlukan untuk mana-mana varian Granite 4.2, jadi ketiadaan caj API tidak boleh dikelirukan dengan kos sifar. Peralatan pengkomputeran, persediaan dan operasi kekal tidak diketahui berkaitan.
Fokus produk pada penggunaan alat adalah penting kerana banyak sistem AI sedang direka bentuk untuk menjalankan urutan tindakan, bukan sekadar menjawab gesaan terpencil. Model yang dilatih untuk akses terminal, carian web dan alat luaran boleh berfungsi sebagai komponen dalam sistem ejen tempatan. Kemungkinan itu adalah berdasarkan keupayaan yang diterangkan oleh Ars Technica, tetapi sumber itu tidak mendokumenkan produk ejen siap, penggunaan autonomi atau aliran kerja dunia sebenar yang berjaya. Pembaca harus membezakan model yang dilatih untuk tugasan ini daripada sistem pengeluaran yang ditunjukkan.
Keluaran ini juga bersambung dengan kebangkitan model penghala, yang Ars Technica huraikan sebagai alat yang mentafsir gesaan, tugas atau projek dan menghantarnya kepada model yang dipilih untuk mengimbangi prestasi, kelajuan dan kos. Julat saiz Granit 4.2 boleh menjadikannya satu calon dalam campuran sedemikian, tetapi sumber itu tidak melaporkan IBM menyepadukannya ke dalam penghala atau memberikan bukti bahawa keluarga itu memberikan kelebihan prestasi kos tertentu. Pengambilalihan yang disokong paling kukuh ialah IBM meletakkan keluarga model yang boleh digunakan secara tempatan untuk kegunaan perusahaan yang boleh diramal sambil menambahkan lebih gelagat ejen yang khusus pada versi yang lebih besar.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What is a common training objective for an autoregressive language model?
Apa yang perlu ditonton seterusnya
Soalan paling penting yang belum diselesaikan ialah bagaimana Granit 4.2 berprestasi dalam amalan. Ars Technica tidak memberikan hasil penanda aras bebas, harga, keperluan perkakasan, butiran lesen, penilaian keselamatan atau bukti penggunaan pengeluaran. Ia juga tidak menentukan sama ada model baharu itu mengatasi prestasi Nemotron atau model awan Nvidia pada beban kerja tertentu. Pelaporan masa hadapan harus meneliti kelajuan sebenar model, keperluan memori, kebolehpercayaan penggunaan alat dan kadar ralat merentas tugasan yang realistik. Ia juga harus menjelaskan sejauh mana pembelajaran pengukuhan agen meningkatkan versi 8B dan 30B, dan di mana model 3B yang lebih kecil kekal berguna walaupun menerima latihan yang kurang khusus.
Ujian bebas adalah bahagian terbesar yang hilang. Ars Technica melaporkan spesifikasi dan kedudukan produk IBM tetapi tidak membentangkan hasil penanda aras perbandingan terhadap Nemotron, model berat terbuka lain atau sistem awan sempadan. Penilaian masa depan harus mengukur ketepatan, kependaman, pengendalian konteks, kejayaan penggunaan alat dan pemulihan kegagalan pada tugas perwakilan dan bukannya hanya bergantung pada kiraan parameter atau spesifikasi konteks 128,000 token.
Kekangan penggunaan juga masih tidak jelas. Sumber itu tidak menyatakan keperluan memori, pemproses atau pemecut untuk varian 3B, 8B atau 30B, dan juga tidak menyediakan saiz muat turun, pilihan pengkuantitian, syarat pelesenan atau sokongan pemasangan di luar rujukan artikel kepada pengehosan sendiri dan kapsyen Ollamanya. Butiran tersebut akan menentukan sama ada model itu praktikal untuk pembangun individu, organisasi kecil atau pemasangan perusahaan yang lebih besar.
Latihan khusus versi 8B dan 30B patut diteliti. Ars Technica mengenal pasti penggunaan terminal, carian web dan alat luaran sebagai keupayaan sasaran, tetapi ia tidak melaporkan betapa handalnya model memilih alatan, mengikut arahan, mengendalikan output yang salah atau mengelakkan tindakan berbahaya. Pengujian harus memeriksa bukan sahaja sama ada ejen boleh menyelesaikan tugas, tetapi juga sama ada ia berhenti apabila tidak pasti dan kekal boleh diramal apabila alat atau maklumat yang diambil berkelakuan di luar jangkaan.
Tuntutan perusahaan keluaran itu juga harus disemak terhadap bukti penggunaan. Ars Technica berkata padang IBM menekankan kebolehramalan, tetapi ia tidak mengenal pasti pelanggan yang dinamakan, beban kerja pengeluaran, keputusan peringkat perkhidmatan atau kajian kes organisasi menggunakan Granite 4.2. Ia juga tidak diketahui sama ada IBM akan menyediakan kemas kini berterusan, dokumentasi keselamatan atau sokongan untuk model tersebut. Faktor tersebut akan membantu menentukan sama ada Granit 4.2 mewakili pilihan perusahaan praktikal atau mengembangkan menu model yang tersedia untuk percubaan tempatan.