Mellum2.1 dari JetBrains tersedia sebagai model 12 miliar parameter dengan 2,5 miliar parameter aktif. Repositori BF16 dan repositori GGUF terpisah sama-sama tersedia di Hugging Face. Untuk percobaan lokal pertama, repositori GGUF menjelaskan jalur llama.cpp: unduh berkas terkuantisasi sesuai kebutuhan, mulai server lokal, kirim prompt, dan periksa jawabannya sebelum memberi agen pengodean akses ke repositori.
Panduan penyiapan ini berdasarkan dokumentasi. BIG CHANGE tidak memasang Mellum2.1 atau menjalankan perintah di bawah. Pemeriksaan sukses adalah completion lokal yang dikembalikan server; itu tidak membuktikan kualitas kode, keandalan agen, atau kinerja pada perangkat keras Anda.
Yang dibutuhkan
- Komputer Windows, macOS, atau Linux dengan memori dan penyimpanan yang cukup untuk model pilihan dan runtime-nya. Kartu JetBrains mencantumkan model asli BF16 dengan konteks 131.072 token. Repositori GGUF merekomendasikan berkas Q4_K_M berukuran 8,1 GB. Itu ukuran berkas, bukan perkiraan lengkap memori runtime: runtime, konteks, dan proses lain memerlukan sumber daya tambahan. JetBrains tidak menerbitkan kebutuhan minimum memori.
- Koneksi internet untuk unduhan awal perangkat lunak dan model. Permintaan inferensi dapat dikirim ke server lokal.
- llama.cpp dan terminal. Repositori mendokumentasikan
winget install llama.cppuntuk Windows dan perintahllama serveuntuk penyajian lokal.
Model dirilis dengan lisensi Apache 2.0. Tidak ada biaya penggunaan bobot yang tercantum; JetBrains tidak menghitung biaya perangkat keras, listrik, penyimpanan, atau infrastruktur sewaan pilihan Anda. Kartu model BF16 saat ini menyatakan tidak ada penyedia inferensi yang melayani repositori tersebut. Repositori GGUF adalah artefak terkuantisasi terpisah dengan quickstart llama.cpp sendiri.
Langkah 1: pasang llama.cpp dan mulai server lokal
Di PowerShell pada Windows, pasang llama.cpp dengan quickstart GGUF resmi Mellum2.1.
winget install llama.cppBuka terminal baru jika perintah llama belum ada di PATH Anda. Jalankan build Q4_K_M yang direkomendasikan dan ikat secara eksplisit ke komputer lokal pada port 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080Repositori GGUF mendokumentasikan ID model dan kuantisasi ini untuk llama serve; repositori juga menjelaskan cara pemasangan di Windows. Referensi server llama.cpp mendokumentasikan --host dan --port; endpoint contohnya di repositori adalah http://localhost:8080/v1. Pada macOS dan Linux, repositori GGUF yang sama mendokumentasikan pemasangan llama.cpp dengan curl -LsSf https://llama.app/install.sh | sh lalu menjalankan perintah serve yang sama.
Proses harus mengunduh model sebelum respons pertama. Berkas Q4_K_M tercantum berukuran 8,1 GB. Untuk tes ini, ikat server hanya ke komputer Anda; jangan paparkan ke jaringan atau masukkan kredensial ke prompt. Repositori juga mencantumkan berkas MXFP4_MOE yang lebih kecil, 7,0 GB, serta varian Q6_K, Q8_0, dan BF16 yang lebih besar. Kuantisasi mengubah artefak model; ukuran berkas saja tidak menunjukkan apakah komputer tertentu dapat menyajikannya dengan panjang konteks atau kecepatan yang berguna.
Jika perintah gagal dimulai, periksa dahulu ID model yang tepat, ruang disk yang tersedia, versi llama.cpp, dan teks kesalahan lengkap. Kegagalan alokasi memori adalah alasan untuk berhenti dan memeriksa opsi runtime serta pengaturan konteks terhadap dokumentasi llama.cpp terkini; itu bukan bukti bahwa modelnya rusak. Jangan menganggap konteks 131.072 token yang diterbitkan akan muat di komputer Anda.
Langkah 2: kirim prompt uji singkat
Biarkan server tetap berjalan. Di jendela PowerShell kedua, kirim permintaan singkat ke API lokalnya:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}ID model, endpoint lokal, dan nilai sampling mengikuti contoh API repositori. max_tokens = 512 adalah nilai terbatas yang dipilih untuk pemeriksaan singkat ini, bukan rekomendasi kartu model. Mellum2.1 adalah model berpikir; kartu GGUF menyebut model mengeluarkan penalaran dalam blok <think>...</think>. Kode melaporkan apakah bidang reasoning_content yang terpisah tidak kosong tanpa mencetak bidang itu. Bergantung pada format penalaran runtime, content masih dapat memuat teks <think>. Prompt ini adalah uji singkat, bukan benchmark kualitas model.
Pemeriksaan dasar hanya lulus jika permintaan mengembalikan completion, bukan kesalahan koneksi atau server; finish_reason bukan length; dan content akhir memuat MELLUM21-LOCAL-OK. HTTP sukses saja tidak cukup: model berpikir dapat menghabiskan anggaran keluaran kecil sebelum menghasilkan teks akhir yang diminta. Jika keluaran kosong, penanda hilang, atau finish_reason bernilai length, anggap pemeriksaan belum meyakinkan; naikkan anggaran keluaran terbatas dan coba lagi, bukan mendiagnosis kegagalan model. Jika PowerShell melaporkan koneksi gagal, pastikan terminal pertama masih menampilkan server berjalan dan permintaan memakai port 8080. Jika server mengembalikan kesalahan, simpan pesan persisnya dan selesaikan sebelum menguji agen pengodean. Respons sukses memastikan jalur inferensi lokal ini dapat menjawab satu permintaan; itu tidak memastikan model dapat mengedit kode dengan aman.
Langkah 3: periksa sebelum menghubungkan agen
Pisahkan evaluasi pertama dari proyek aktif. Gunakan repositori sementara dengan tugas kecil yang diketahui, dan catat artefak serta kuantisasi model, versi llama.cpp, sistem operasi, pengaturan konteks, prompt, keluaran, waktu yang berlalu, dan penggunaan sumber daya. Minta perubahan terbatas, periksa diff yang diusulkan, dan jalankan sendiri tes repositori yang ada. Untuk perbandingan, ulangi tugas yang sama dengan baseline Anda saat ini. Satu prompt atau satu tes sukses bukan benchmark.
Server model mengembalikan teks dan, bergantung pada runtime dan format permintaan, dapat mendukung alur pemanggilan alat terstruktur. Server itu sendiri tidak menentukan alat apa yang dapat digunakan agen atau menjalankannya dengan aman. Agen di sekelilingnya mengendalikan akses repositori, perintah shell, penyuntingan berkas, dan eksekusi tes. Mulai dengan akses hanya-baca atau cakupan ketat, minta persetujuan untuk penulisan dan perintah, tinjau setiap diff, dan jauhkan rahasia dari repositori uji serta prompt. Hentikan jika agen melampaui tugas, mengubah berkas yang tidak terkait, atau tidak dapat menjelaskan tes yang gagal.
Untuk penggunaan privat, pastikan lokasi inferensi berjalan dan konfigurasi agen. Proses model lokal dapat menyimpan prompt di komputer Anda bila permintaan tetap pada endpoint lokal, tetapi agen mungkin tetap memanggil layanan eksternal untuk fitur lain. Periksa akses jaringan, pencatatan, telemetri, dan izin alat aplikasi sebelum memakai kode atau data privat.
Langkah 4: apa yang ditunjukkan dan tidak ditunjukkan bukti terbitan
JetBrains menggambarkan Mellum2.1 sebagai model mixture-of-experts 12B dengan 2,5B parameter aktif, presisi BF16, dan konteks 131.072 token. Kartu model menyatakan rilisnya memakai Apache 2.0 dan menjelaskan post-training yang mencakup pembelajaran penguatan dalam lingkungan perangkat lunak sandbox. JetBrains juga menerbitkan hasil benchmark, termasuk evaluasi pengodean agentik. Skor itu dilaporkan sendiri oleh JetBrains; bukan pengukuran BIG CHANGE dan tidak memprediksi throughput perangkat keras atau hasil proyek Anda.
Satu detail rilis berubah di berbagai halaman publikasi. Tulisan peluncuran JetBrains 8 Oktober menyebut build GGUF akan ‘segera tersedia’. Pada 9 Oktober, repositori GGUF resmi di Hugging Face dapat diakses dan memuat quickstart llama.cpp, Ollama, dan lainnya. Panduan ini memakai repositori GGUF yang saat ini diterbitkan. Repositori BF16 tetap artefak terpisah; periksa kedua repositori sebelum mengulang langkah ini.
Perubahan besar
Kini Anda dapat mengikuti quickstart llama.cpp yang diterbitkan untuk build Mellum2.1 terkuantisasi dan menanyakannya melalui endpoint lokal yang kompatibel dengan OpenAI. Ini membuat pemeriksaan inferensi mandiri pertama praktis tanpa mengandalkan deployment penyedia inferensi untuk repositori BF16. Respons membuktikan jalur penyajian berfungsi; bukan bukti kualitas agen, kecocokan, privasi seluruh toolchain, atau kesiapan produksi.
Sumber dan bacaan lanjutan
- JetBrains: “Mellum2.1 Mulai Bekerja” (8 Oktober 2026) — deskripsi peluncuran dan pernyataan awal tentang ketersediaan GGUF.
- Kartu model BF16 JetBrains Mellum2.1 — detail model, panduan vLLM dan Transformers, benchmark, dan lisensi.
- Repositori GGUF JetBrains Mellum2.1 — kuantisasi terkini, ukuran berkas, perintah llama.cpp, dan contoh API lokal.
- Proyek llama.cpp — sumber runtime dan informasi rilis.



