Kembali ke Berita
produkAI Understanding taklimat

SpaceXAI Mengeluarkan Grok 4.6 untuk Ejen Pengekodan Jangka Panjang

SpaceXAI berkata Grok 4.6 kini tersedia dengan tetingkap konteks 500,000 token, kawalan penaakulan yang diperluas dan latihan yang bertujuan untuk pengekodan, penyelidikan dan kerja projek interaktif yang berterusan.

6 min readRead the primary source
Dokumen sumber utamaSumber direkodkan
Penerbit
SpaceXAI's August 12 Grok 4.6 announcement and API documentation
Pautan sumber
docs.x.aihttps://docs.x.ai/developers/grok-4-6
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
XAI (AI Boleh Diterangkan)
Teknik dan amalan untuk membuat ramalan AI lebih telus dan mudah difahami.
Asal Data
Asal yang didokumenkan, pemilikan dan sejarah set data atau artifak model.
Uji diri andaKuiz Agen AI

Apa yang berlaku

SpaceXAI mengeluarkan Grok 4.6 pada 12 Ogos sebagai model sempadan yang bertujuan untuk pengekodan, tugas agen dan kerja pengetahuan. Syarikat itu berkata model itu direka bentuk untuk kekal berkesan merentasi kerja berbilang langkah yang lebih panjang: menyelidik subjek yang tidak dikenali, menganalisis maklumat, menukar pangkalan kod dan menukar idea kepada aplikasi yang berfungsi atau artifak lain yang digilap. Keluaran ini tersedia melalui API xAI, Grok Build, Cursor, dan gerbang model termasuk OpenRouter, Vercel dan Cloudflare. Ia adalah produk yang dihantar dan bukannya pengumuman peta jalan, walaupun kebanyakan bukti prestasi yang diterbitkan setakat ini datang daripada SpaceXAI sendiri.

Dokumentasi API rasmi mengenal pasti model sebagai `grok-4.6` dan memberikannya tetingkap konteks 500,000 token. Ia menerima input teks dan imej serta menghasilkan output teks, tanpa had keluaran teks yang dinyatakan. Pembangun boleh memilih usaha penaakulan rendah, sederhana, tinggi atau xtinggi. SpaceXAI menyenaraikan harga asas di bawah 200,000 token segera pada $2 setiap juta token input, $0.50 setiap juta token input cache dan $6 setiap juta token output; gesaan di atas ambang itu masing-masing berharga $4, $1 dan $12. Varian pantas berharga dua kali ganda daripada kadar asas. Ini ialah harga pelancaran dan spesifikasi produk, bukan jaminan kependaman, ketersediaan atau jumlah kos beban kerja.

SpaceXAI berkata Grok 4.6 menerima latihan tambahan yang lebih lama daripada Grok 4.5. Syarikat itu menerangkan bahan yang dijana model yang dipilih susun untuk penaakulan dan konsep teknikal lanjutan, data kejuruteraan berkualiti tinggi dan perubahan kepada pengoptimuman dan resipi latihan. Ia kemudiannya menggunakan Grok 4.5 untuk menjana semula trajektori penalaan halus diselia merentas tetapan penaakulan, abah-abah ejen, STEM, kejuruteraan perisian dan kerja pengetahuan, dengan semakan berasaskan model menapis kesan bermasalah. Persekitaran pembelajaran pengukuhan dilaporkan meliputi pengekodan umum, kerja pengetahuan, pengoptimuman kernel, pembangunan web dan reka bentuk bantuan komputer. Pengumuman tidak mendedahkan kiraan parameter, pengiraan latihan, asal data yang lengkap atau perincian pelaksanaan yang mencukupi untuk kumpulan luar menghasilkan semula proses latihan.

Pelancaran itu menekankan kerja yang berterusan dan penciptaan produk dan bukannya satu jawapan pengekodan terpencil. SpaceXAI berkata projek dalaman menunjukkan hantaran pertama yang lebih kuat pada aplikasi visual dan interaktif daripada Grok 4.5, diikuti dengan penghalusan berulang dan lebih banyak ujian kendiri pada trajektori yang lebih panjang. Itulah huraian berguna tentang tingkah laku yang dimaksudkan, tetapi contoh awam adalah demonstrasi terpilih. Mereka tidak menentukan kekerapan model mengesan ralatnya sendiri, sama ada pengesahan menangkap regresi yang halus atau cara prestasi berubah apabila ejen mempunyai alat yang terhad, konteks yang tidak lengkap, repositori warisan yang besar atau tugas yang berjalan selama berjam-jam.

Syarikat itu melaporkan skor Indeks Kecerdasan Analisis Buatan sebanyak 61, sepadan dengan skor yang disenaraikan untuk GPT-5.6 Sol dan satu mata di belakang Fable 5 Max. Jadualnya juga melaporkan 69.9% pada CursorBench 3.2, 65.9% pada DeepSWE 1.1, 61.3% pada FrontierCode 1.1 Extended, 57.5% pada APEX-Agents dan 26% pada Terminal-Bench 3.0. Hasilnya adalah bercampur dan bukannya petunjuk universal: jadual meletakkan model lain di hadapan pada beberapa ujian pengekodan dan terminal. SpaceXAI berkata angka pihak ketiga menggunakan hasil terbaik yang dilaporkan sendiri atau tersedia secara umum, jadi perbezaan dalam memanfaatkan, belanjawan penaakulan dan tetapan ujian kekal sebagai had penting.

Butiran sumber: SpaceXAI's August 12 Grok 4.6 announcement and API documentation ↗

Mengapa ia penting

Grok 4.6 menyertai perlumbaan model yang semakin dianjurkan di sekitar ejen yang boleh menjalankan projek dan bukannya sekadar menjawab gesaan. Tetingkap konteks yang besar, penaakulan boleh laras, penggunaan alat dan latihan pada trajektori yang panjang boleh memudahkan pembangun atau pasukan kecil untuk mewakilkan bahagian penyelidikan, pengekodan, ujian dan semakan yang terhad. Nilai praktikal akan bergantung kurang pada satu kedudukan papan pendahulu berbanding sama ada model itu boleh mengekalkan keperluan, menggunakan alatan dengan selamat dan menghasilkan kerja yang boleh diperiksa dan diperbetulkan oleh seseorang.

Untuk pasukan perisian, kesinambungan ialah tuntutan produk utama. Ejen yang telah lama berjalan mesti mengingati kekangan seni bina, memahami perubahan yang dibuat lebih awal dalam sesi, mengelakkan membuat asal kerja yang betul dan mengesahkan bahawa pembetulan tidak memecahkan bahagian lain sistem. Tetingkap 500,000 token memberikan ruang model untuk lebih banyak konteks repositori dan sejarah alat, tetapi kapasiti konteks tidak sama dengan penarikan balik atau penaakulan yang boleh dipercayai. Gesaan besar boleh termasuk bahan yang tidak berkaitan atau bercanggah, kos lebih tinggi melebihi ambang harga 200,000 token xAI, dan masih gagal mengandungi satu fail atau keperluan yang menentukan jawapan yang betul.

Penerangan latihan juga menunjukkan cara makmal sempadan menggunakan model terdahulu untuk mengeluarkan dan menapis trajektori untuk yang kemudian. Menjana semula contoh di bawah seliaan merentas beberapa usaha penaakulan dan memanfaatkan ejen boleh meningkatkan konsistensi antara model dan persekitaran di mana ia akan beroperasi. Ia juga menimbulkan soalan yang tidak terjawab tentang pewarisan kesilapan dan kebebasan penilaian. Jika satu model mencipta jejak latihan dan semakan berasaskan model memutuskan jejak yang masih hidup, pembangun memerlukan bukti bahawa sistem yang terhasil bukan sekadar menjadi lebih baik dalam memuaskan hati hakim automatik yang sama sambil mengekalkan titik buta yang terlepas oleh hakim tersebut.

Ketersediaan merentas API, Kursor, Grok Build dan get laluan mengurangkan geseran ujian keluaran dalam aliran kerja sedia ada. Tawaran pengenalan dua kali ganda penggunaan yang disertakan dalam Cursor dan Grok Build selama satu minggu boleh mempercepatkan percubaan dunia sebenar. Pasukan masih harus membandingkan jumlah kos tugas, masa penyiapan, usaha pembetulan dan pemulihan kegagalan dan bukannya harga token sahaja. Varian pantas mungkin membantu kerja interaktif, tetapi menggandakan harga per-token menghasilkan pertukaran yang hanya dapat diselesaikan oleh ujian peringkat tugasan. Model yang lebih perlahan yang selesai dengan betul pada percubaan pertama boleh menjadi lebih murah daripada model pantas yang memerlukan pembaikan berulang.

Sempadan kepentingan awam adalah sama pentingnya dengan prestasi pengekodan. Ejen yang beroperasi merentasi fail, penyemak imbas, terminal atau sistem perniagaan boleh menyebarkan andaian yang salah lebih jauh daripada jawapan chatbot konvensional. SpaceXAI berkata Grok 4.6 menerima suite ujian pra-pengerahan terluasnya dan diperluaskan selepas penempatan dan ujian pihak ketiga, tetapi pengumuman itu hanya memberikan penerangan keselamatan peringkat tinggi. Ia tidak menerbitkan kad sistem terperinci, keputusan penolakan dan penyalahgunaan yang diasingkan, ambang insiden atau bukti untuk setiap domain yang syarikat mengatakan bahawa perlindungan telah ditentukur. Pengguna harus menganggap bahasa keselamatan sebagai tuntutan vendor sementara menunggu dokumentasi yang lebih lengkap dan ujian bebas.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Apa yang perlu ditonton seterusnya

Bukti yang menentukan akan datang daripada ujian yang boleh dibuat semula dan projek biasa selepas pelancaran. Tonton sama ada Grok 4.6 boleh menyelesaikan tugas yang panjang tanpa hanyut, sama ada ujian kendirinya menemui kecacatan sebenar, cara kosnya berubah dengan konteks dan percubaan semula yang besar, dan sama ada SpaceXAI menerbitkan butiran keselamatan dan penilaian yang mencukupi untuk orang luar memeriksa tuntutan. Ketersediaan awal adalah bermakna; autonomi yang boleh dipercayai kekal sebagai persoalan empirikal.

Pertama, bandingkan model di bawah keadaan yang sepadan. Penilai bebas harus mengekalkan abah-abah ejen, alatan, petikan repositori, had masa, belanjawan token dan usaha penaakulan tetap apabila membandingkan Grok 4.6 dengan Grok 4.5 dan sistem yang bersaing. Laporan yang berguna harus merangkumi tugasan yang telah selesai, kejayaan separa, regresi, panggilan alat tidak sah, campur tangan manusia, masa jam dinding dan jumlah kos. Peratusan penanda aras tunggal tidak dapat menunjukkan sama ada kegagalan mudah dibaiki atau sama ada ejen menukar fail yang tidak berkaitan secara senyap semasa memperoleh keputusan ujian yang lulus.

Kedua, uji tuntutan konteks panjang sebagai soalan sistem. Pembangun harus mengubah saiz repositori dan kualiti konteks, kemudian mengukur sama ada model mendapatkan semula kekangan yang betul, mengekalkan rancangan melalui pemadatan, dan melihat percanggahan yang diperkenalkan lebih awal dalam trajektori. Dokumentasi mengesyorkan kunci cache segera supaya meminta laluan secara konsisten dan hits cache kekal andal, dan ia menunjukkan gelung panjang ke arah pemadatan konteks. Ciri tersebut boleh meningkatkan ekonomi dan kesinambungan, tetapi pasukan perlu memantau pemadatan yang dialih keluar dan sama ada perbualan yang dicache mengekalkan andaian usang selepas projek asas berubah.

Ketiga, cari pendedahan keselamatan yang lebih lengkap. SpaceXAI berkata perlindungannya meliputi tampalan kerentanan yang sah, reka bentuk kejuruteraan dan penyelidikan AI, dengan pra-penyerahan, pasca-pengerahan dan ujian pihak ketiga yang luas. Penerbitan berguna seterusnya akan mengenal pasti model ancaman, set penilaian, ambang lulus, keupayaan berisiko tinggi, mod kegagalan yang diketahui dan mitigasi pada kedua-dua model dan lapisan produk. Ia harus membezakan perkara yang dipelajari oleh model asas daripada apa yang dikuatkuasakan oleh Grok Build, Cursor, get API atau kotak pasir pelanggan sendiri. Tanpa pengasingan itu, pengguna tidak dapat memberitahu harta keselamatan mana yang dibawa bersama model dan yang bergantung pada aplikasi sekeliling.

Akhir sekali, tonton penggunaan selepas insentif minggu pelancaran. Pengguna Cursor dan Grok Build boleh menguji Grok 4.6 serta-merta, manakala pelanggan API boleh memilih inferens biasa atau lebih pantas. Penggunaan berterusan, bedah siasat awam dan perbandingan peringkat tugas akan menunjukkan sama ada laluan pertama interaktif model yang lebih kukuh diterjemahkan ke dalam perisian yang boleh diselenggara dan artifak penyelidikan yang berguna. SpaceXAI telah menghantar pilihan material baharu dengan spesifikasi konkrit. Apa yang masih tidak diketahui ialah sejauh mana ia boleh dipercayai mengekalkan kerja autonomi dalam persekitaran pengeluaran yang tidak kemas, di mana kebenaran, keperluan yang tidak lengkap, menukar fail dan semakan manusia penting seperti keupayaan penanda aras mentah.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanPengekodan AIKeselamatan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?