BeritaAiTekno

SpaceXAI Rilis Grok 4.7, Bisa Kerjakan Coding Kompleks Berjam-jam

12
×

SpaceXAI Rilis Grok 4.7, Bisa Kerjakan Coding Kompleks Berjam-jam

Share this article
SpaceXAI Rilis Grok 4.7

Suara-Sumut.id – SpaceXAI resmi memperkenalkan model kecerdasan buatan (AI) terbarunya, Grok 4.7, pada pekan ini. Model tersebut menjadi penerus Grok 4.6 dengan sejumlah peningkatan kemampuan, terutama untuk menangani pekerjaan yang membutuhkan proses panjang dan terdiri dari banyak tahapan.

Salah satu kemampuan yang menjadi perhatian adalah kemampuan Grok 4.7 dalam mengerjakan tugas coding kompleks dalam waktu yang lama. Model AI ini disebut mampu menjalankan pekerjaan selama berjam-jam tanpa harus terus-menerus diarahkan oleh pengguna.

Tidak hanya menjalankan tugas, Grok 4.7 juga diklaim dapat memeriksa kembali hasil pekerjaan yang telah dibuat secara mandiri. Kemampuan tersebut dirancang untuk membantu model menemukan kesalahan atau memastikan tahapan pekerjaan telah dilakukan sesuai kebutuhan.

SpaceXAI menyebut peningkatan kemampuan Grok 4.7 berkaitan dengan proses pelatihan yang menggunakan metode reinforcement learning dalam durasi lebih panjang dibandingkan model sebelumnya.

SpaceXAI Rilis Grok 4.7

Grok 4.7 dilatih dengan reinforcement learning lebih lama

Reinforcement learning merupakan salah satu metode yang digunakan dalam pengembangan model AI. Secara sederhana, metode ini memberikan penilaian terhadap hasil yang dihasilkan model sehingga AI dapat belajar menghasilkan respons atau pekerjaan yang lebih baik pada proses berikutnya.

Pada Grok 4.7, SpaceXAI mengatakan materi reinforcement learning yang digunakan tidak hanya lebih banyak, tetapi juga lebih kompleks. Proses pelatihan tersebut ditujukan untuk meningkatkan kemampuan model dalam menyelesaikan pekerjaan yang tidak dapat diselesaikan hanya dengan satu langkah.

Pendekatan tersebut juga diarahkan untuk membuat Grok 4.7 lebih mampu menangani tugas dengan banyak tahapan, konteks yang panjang, serta pekerjaan yang membutuhkan proses verifikasi. Dengan kemampuan tersebut, model diharapkan tidak hanya memberikan jawaban berdasarkan permintaan awal, tetapi juga dapat menjalankan proses kerja yang lebih panjang.

Kemampuan semacam ini terutama relevan untuk pekerjaan coding. Dalam pengembangan perangkat lunak, sebuah tugas dapat membutuhkan beberapa tahapan, mulai dari memahami kode, menemukan masalah, melakukan perubahan, menjalankan pengujian, hingga memeriksa kembali hasilnya.

Grok 4.7 diklaim dirancang untuk menangani alur pekerjaan semacam itu dengan lebih mandiri dibandingkan generasi sebelumnya.

Skor benchmark coding Grok 4.7 meningkat

Peningkatan kemampuan coding Grok 4.7 juga terlihat dari sejumlah hasil pengujian benchmark. Dalam pengujian CursorBench 4.0, Grok 4.7 disebut memperoleh skor 46,3 persen.

Angka tersebut meningkat dibandingkan Grok 4.6 yang sebelumnya mencatat skor 40,4 persen pada pengujian yang sama. Perbedaan tersebut menunjukkan adanya peningkatan performa pada tugas coding yang diuji melalui benchmark tersebut.

Pada pengujian DeepSWE v1.1, Grok 4.7 memperoleh skor 71 persen ketika menggunakan konfigurasi high effort. Sebagai pembanding, Grok 4.6 mencatat skor 65,2 persen.

Peningkatan juga tercatat dalam pengujian yang berkaitan dengan penggunaan AI melalui terminal atau command line. Pada Terminal-Bench 4.0, Grok 4.7 disebut mendapatkan skor 38 persen.

Sementara itu, Grok 4.6 mencatat skor 20,3 persen pada pengujian tersebut. Dengan demikian, perbedaan skor antara kedua model terlihat cukup besar pada benchmark yang menguji kemampuan AI dalam bekerja melalui lingkungan terminal.

Berbagai hasil benchmark tersebut menjadi salah satu indikator yang digunakan untuk menggambarkan peningkatan kemampuan Grok 4.7 dibandingkan pendahulunya. Namun, skor benchmark tetap menggambarkan performa pada pengujian tertentu dan tidak selalu mewakili seluruh jenis pekerjaan coding yang ditemui dalam penggunaan sehari-hari.

Bukan hanya untuk coding

SpaceXAI juga mencatat peningkatan kemampuan Grok 4.7 pada sejumlah pekerjaan profesional di luar coding. Model tersebut diuji pada berbagai bidang yang membutuhkan pemrosesan informasi teknis dan penyelesaian persoalan dengan tingkat kompleksitas tertentu.

Dalam pengujian AI dan persoalan teknis EEBench, Grok 4.7 memperoleh skor 64 persen. Angka tersebut meningkat dari 53 persen yang dicatat Grok 4.6.

Peningkatan juga terlihat pada pengujian yang berkaitan dengan persoalan hukum. Dalam Harvey Legal Agent Benchmark, Grok 4.7 mendapatkan skor 19,6 persen, sedangkan Grok 4.6 sebelumnya berada di angka 15,8 persen.

Sementara untuk pengujian yang berkaitan dengan persoalan kesehatan melalui HealthBench Professional, Grok 4.7 mencatat skor 56,7 persen. Model generasi sebelumnya, Grok 4.6, memperoleh skor 48,5 persen.

Hasil tersebut menunjukkan bahwa peningkatan yang dibawa Grok 4.7 tidak hanya diarahkan pada kemampuan menulis atau memperbaiki kode. SpaceXAI juga menyebut adanya peningkatan pada sejumlah tugas profesional dan teknis lainnya.

Meski demikian, hasil benchmark pada bidang hukum dan kesehatan tetap perlu dipahami sebagai hasil pengujian model, bukan pengganti tenaga profesional. Angka benchmark menunjukkan performa dalam skenario pengujian tertentu dan tidak dengan sendirinya menggambarkan kemampuan model pada setiap situasi nyata.

Harga Grok 4.7 tetap sama dengan Grok 4.6

Di tengah peningkatan kemampuan tersebut, harga penggunaan Grok 4.7 disebut tidak berubah dibandingkan model sebelumnya. SpaceXAI menetapkan tarif sebesar 2 dollar AS atau sekitar Rp 35.700 untuk setiap 1 juta input token.

Sementara untuk output, tarif yang ditetapkan mencapai 6 dollar AS atau sekitar Rp 107.000 per 1 juta output token. Harga tersebut sama persis dengan tarif Grok 4.6.

Input token merujuk pada informasi yang diberikan kepada model untuk diproses, sedangkan output token berkaitan dengan hasil yang dihasilkan model. Karena biaya dihitung berdasarkan jumlah token, total penggunaan dapat berbeda tergantung kompleksitas pekerjaan yang diberikan kepada AI.

SpaceXAI sendiri menyebut penggunaan token Grok 4.7 pada tugas tertentu dapat jauh lebih tinggi dibandingkan model sebelumnya. Artinya, meskipun harga per 1 juta token tetap sama, biaya penggunaan dalam praktik belum tentu sama.

Grok 4.7 bisa menggunakan lebih banyak token

Data Artificial Analysis yang dihimpun oleh WCCFTech menunjukkan adanya perbedaan penggunaan token ketika Grok digunakan untuk menyelesaikan tugas tertentu. Grok 4.7 dengan konfigurasi xhigh disebut menggunakan sekitar 81.000 output token per tugas dalam Intelligence Index.

Sementara Grok 4.6 dengan konfigurasi high menggunakan sekitar 36.000 token. Perbedaan tersebut menunjukkan bahwa model baru dapat menggunakan lebih banyak token untuk menyelesaikan pekerjaan tertentu, terutama ketika menjalankan proses dengan tingkat upaya yang lebih tinggi.

Penggunaan token yang lebih banyak dapat berkaitan dengan kemampuan model dalam menjalankan pekerjaan secara lebih panjang dan melakukan proses tambahan sebelum memberikan hasil akhir. Karena itu, biaya aktual penggunaan Grok 4.7 sangat bergantung pada jenis pekerjaan dan jumlah token yang diperlukan untuk menyelesaikannya.

Dengan kata lain, pengguna tidak cukup hanya melihat harga per 1 juta token ketika memperkirakan biaya penggunaan. Kompleksitas tugas, konfigurasi model, serta panjang proses yang dijalankan juga dapat memengaruhi jumlah token yang digunakan.

Tersedia varian Grok 4.7 Fast

Selain versi reguler, SpaceXAI juga menyediakan varian yang disebut Grok 4.7 Fast. Sesuai namanya, varian tersebut menawarkan kecepatan keluaran yang lebih tinggi dibandingkan versi biasa.

Grok 4.7 Fast disebut memiliki kecepatan keluaran sekitar dua kali lebih tinggi. Namun, peningkatan kecepatan tersebut dibarengi dengan tarif penggunaan yang juga dua kali lipat.

Varian tersebut dapat menjadi pilihan bagi pengguna yang lebih membutuhkan kecepatan dalam memperoleh hasil. Sementara itu, versi reguler dapat digunakan sesuai kebutuhan pekerjaan dan konfigurasi yang tersedia.

Grok 4.7 sudah tersedia di sejumlah platform

SpaceXAI mengatakan Grok 4.7 telah tersedia melalui sejumlah platform. Pengguna dapat mengakses model tersebut melalui Grok Build, layanan coding Cursor, serta Grok API.

Model ini juga tersedia melalui sejumlah platform coding harness pihak ketiga, model router, dan platform cloud. Ketersediaan di berbagai layanan tersebut membuat Grok 4.7 tidak hanya ditujukan untuk penggunaan langsung melalui layanan milik SpaceXAI.

Bagi pengembang, akses melalui API dan platform coding dapat membuka kemungkinan penggunaan Grok 4.7 dalam alur kerja pengembangan perangkat lunak. Kemampuan mengerjakan tugas dengan konteks panjang dan melakukan verifikasi secara mandiri menjadi bagian yang ditekankan pada generasi terbaru ini.

Grok 4.7 membawa fokus pada pekerjaan kompleks

Peluncuran Grok 4.7 menunjukkan fokus SpaceXAI pada pengembangan model AI yang tidak hanya cepat memberikan jawaban, tetapi juga mampu menangani pekerjaan yang lebih panjang dan bertahap. Kemampuan coding menjadi salah satu area utama yang ditonjolkan melalui peningkatan skor di sejumlah benchmark.

Model ini juga dirancang untuk menangani konteks panjang dan melakukan proses pemeriksaan terhadap hasil pekerjaannya sendiri. Pendekatan tersebut membuat Grok 4.7 diarahkan untuk pekerjaan yang membutuhkan lebih banyak tahapan dibandingkan sekadar menjawab pertanyaan singkat.

Dari sisi harga token, tarif dasar Grok 4.7 tetap sama dengan Grok 4.6. Namun, jumlah token yang digunakan untuk tugas tertentu dapat meningkat sehingga biaya aktual penggunaan akan bergantung pada kebutuhan pekerjaan.

Dengan tersedianya versi reguler dan Grok 4.7 Fast, pengguna juga memiliki pilihan berdasarkan kebutuhan antara penggunaan yang lebih berorientasi pada proses dan kebutuhan terhadap kecepatan keluaran. Grok 4.7 kini dapat digunakan melalui Grok Build, Cursor, Grok API, serta sejumlah platform coding dan cloud yang mendukungnya.

Leave a Reply

Your email address will not be published. Required fields are marked *