JetBrains-இன் Mellum2.1, 12 பில்லியன் அளவுருக்களைக் கொண்ட மாடலாகக் கிடைக்கிறது; அவற்றில் 2.5 பில்லியன் செயலில் உள்ளன. BF16 களஞ்சியமும் தனியான GGUF களஞ்சியமும் Hugging Face-இல் உள்ளன. முதல் உள்ளூர் இயக்கத்துக்கு, GGUF களஞ்சியம் llama.cpp வழியை விளக்குகிறது: தேவையானபோது quantized கோப்பைப் பதிவிறக்கி, உள்ளூர் சேவையகத்தைத் தொடங்கி, prompt-ஐ அனுப்பி, எந்த coding agent-க்கும் களஞ்சிய அணுகலை வழங்கும் முன் பதிலைப் பாருங்கள்.

இது ஆவணங்களை அடிப்படையாகக் கொண்ட அமைப்பு வழிகாட்டி. BIG CHANGE Mellum2.1-ஐ நிறுவவோ கீழுள்ள கட்டளைகளை இயக்கவோ இல்லை. சேவையகம் உள்ளூர் completion-ஐத் திருப்பித் தருவதே வெற்றிச் சோதனை; அது code தரம், agent நம்பகத்தன்மை அல்லது உங்கள் வன்பொருளில் செயல்திறனை நிரூபிக்காது.

உங்களுக்குத் தேவையானவை

  • தேர்ந்தெடுத்த மாடலுக்கும் அதன் இயக்கச் சூழலுக்கும் போதுமான நினைவகமும் சேமிப்பிடமும் உள்ள Windows, macOS அல்லது Linux கணினி. அசல் மாடல் BF16 என்றும் அதன் context 131,072 tokens என்றும் JetBrains அட்டை குறிப்பிடுகிறது. பரிந்துரைக்கப்படும் Q4_K_M கோப்பு 8.1 GB என GGUF களஞ்சியம் பட்டியலிடுகிறது. அது கோப்பின் அளவு மட்டுமே; இயக்க நேர நினைவகத்தின் முழு மதிப்பீடு அல்ல: இயக்கச் சூழல், context மற்றும் பிற செயல்முறைகளுக்கு கூடுதல் வளங்கள் தேவை. குறைந்தபட்ச நினைவகத் தேவையை JetBrains வெளியிடவில்லை.
  • மென்பொருள் மற்றும் மாடலின் ஆரம்பப் பதிவிறக்கத்திற்கு இணைய இணைப்பு தேவை. inference கோரிக்கையை உள்ளூர் சேவையகத்துக்கே அனுப்பலாம்.
  • llama.cpp மற்றும் ஒரு terminal. Windows-க்கான winget install llama.cpp கட்டளையையும் உள்ளூரில் வழங்குவதற்கான llama serve கட்டளையையும் களஞ்சியம் விளக்குகிறது.

மாடல் Apache 2.0 உரிமத்தின் கீழ் வெளியிடப்பட்டுள்ளது. weights பயன்பாட்டுக் கட்டணம் பட்டியலிடப்படவில்லை; வன்பொருள், மின்சாரம், சேமிப்பிடம் அல்லது வாடகை உள்கட்டமைப்புக்கான செலவுகளை JetBrains கணக்கிடவில்லை. BF16 மாடல் அட்டை, அந்தக் களஞ்சியத்திற்கு எந்த inference provider-மும் சேவை வழங்கவில்லை எனக் கூறுகிறது. GGUF களஞ்சியம் தனியான quantized artifact; அதற்கென llama.cpp விரைவு தொடக்கம் உள்ளது.

படி 1: llama.cpp-ஐ நிறுவி உள்ளூர் சேவையகத்தைத் தொடங்கவும்

Windows PowerShell-இல் அதிகாரப்பூர்வ Mellum2.1 GGUF விரைவு தொடக்கம்:

PowerShell
winget install llama.cpp

இந்த llama கட்டளை இன்னும் PATH-இல் இல்லாவிட்டால் புதிய terminal-ஐத் திறக்கவும். பரிந்துரைக்கப்பட்ட Q4_K_M build-ஐத் தொடங்கி, port 8080-இல் உள்ளூர் கணினியுடன் மட்டும் bind செய்யுமாறு தெளிவாக அமைக்கவும்:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

இந்த model ID மற்றும் quantization-ஐ llama serve பயன்படுத்துவதற்கான விவரத்தை GGUF களஞ்சியம் தருகிறது; Windows நிறுவல் வழியையும் விளக்குகிறது. llama.cpp சேவையகக் குறிப்பு ஆவணப்படுத்துகிறது --host மற்றும் --port; களஞ்சியத்தின் எடுத்துக்காட்டு endpoint http://localhost:8080/v1 . macOS மற்றும் Linux-இல் அதே GGUF களஞ்சியம் curl -LsSf https://llama.app/install.sh | sh மூலம் llama.cpp-ஐ நிறுவி, அதே serve கட்டளையைப் பயன்படுத்தச் சொல்கிறது.

முதல் பதிலுக்கு முன் செயல்முறை மாடலைப் பதிவிறக்க வேண்டும். Q4_K_M கோப்பு 8.1 GB எனக் குறிப்பிடப்பட்டுள்ளது. இந்தச் சோதனைக்கு சேவையகத்தை உங்கள் கணினியுடன் மட்டுமே bind செய்யவும்; அதை network-இல் வெளிப்படுத்தவோ prompt-இல் credentials இடவோ வேண்டாம். 7.0 GB கொண்ட சிறிய MXFP4_MOE கோப்பையும் பெரிய Q6_K, Q8_0, BF16 வகைகளையும் களஞ்சியம் பட்டியலிடுகிறது. Quantization மாடல் artifact-ஐ மாற்றுகிறது; கோப்பு அளவு மட்டும் பார்த்து ஒரு குறிப்பிட்ட கணினி அதை பயனுள்ள context நீளம் அல்லது வேகத்தில் வழங்குமா என அறிய முடியாது.

கட்டளை தொடங்காவிட்டால், துல்லியமான model ID, கிடைக்கும் disk இடம், llama.cpp பதிப்பு மற்றும் முழு பிழை உரையை முதலில் சரிபார்க்கவும். நினைவக ஒதுக்கீடு தோல்வி ஏற்பட்டால் நிறுத்தி, தற்போதைய llama.cpp ஆவணத்தின் அடிப்படையில் runtime விருப்பங்களையும் context அமைப்புகளையும் பாருங்கள்; அது மாடல் பழுதானதற்கான சான்றல்ல. வெளியிடப்பட்ட 131,072-token context உங்கள் கணினியில் பொருந்தும் எனக் கருத வேண்டாம்.

படி 2: smoke-test prompt அனுப்பவும்

சேவையகத்தை இயங்கவிடவும். இரண்டாவது PowerShell சாளரத்தில் அதன் உள்ளூர் API-க்கு குறுகிய கோரிக்கையை அனுப்பவும்:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

Model ID, உள்ளூர் endpoint மற்றும் sampling மதிப்புகள் களஞ்சியத்தின் API எடுத்துக்காட்டைப் பின்பற்றுகின்றன. max_tokens = 512 இந்தக் குறுகிய சோதனைக்காகத் தேர்ந்தெடுக்கப்பட்ட வரையறுக்கப்பட்ட மதிப்பு; மாடல் அட்டையின் பரிந்துரை அல்ல. Mellum2.1 ஒரு thinking model; reasoning-ஐ <think>...</think> blocks-இல் வெளியிடும் என GGUF அட்டை கூறுகிறது. தனியான reasoning_content field காலியாக இல்லை என்பதை code தெரிவிக்கும்; அதை அச்சிடாது. runtime-இன் reasoning வடிவத்தைப் பொறுத்து content இன்னும் <think> text-ஐக் கொண்டிருக்கலாம். இந்த prompt smoke test மட்டுமே; மாடல் தர benchmark அல்ல.

இணைப்பு அல்லது சேவையகப் பிழைக்குப் பதிலாக completion திரும்பினால், finish_reason என்பது length அல்லாவிட்டால், இறுதி content-இல் MELLUM21-LOCAL-OK இருந்தால் மட்டுமே அடிப்படைச் சோதனை வெற்றி பெறும். HTTP வெற்றி மட்டும் போதாது: கேட்கப்பட்ட இறுதி உரையை உருவாக்கும் முன் thinking model சிறிய output budget-ஐச் செலவழிக்கலாம். output காலியாக இருந்தாலோ, marker இல்லாவிட்டாலோ, finish_reason என்பது length ஆக இருந்தாலோ சோதனையை முடிவற்றதாகக் கருதவும்; மாடல் தோல்வி எனக் கண்டறிவதற்குப் பதிலாக வரையறுக்கப்பட்ட output budget-ஐ உயர்த்தி மீண்டும் முயற்சிக்கவும். PowerShell இணைப்புப் பிழை காட்டினால் முதல் terminal-இல் சேவையகம் இன்னும் இயங்குகிறதா, கோரிக்கை port 8080-ஐப் பயன்படுத்துகிறதா என உறுதிசெய்யவும். சேவையகம் பிழை கொடுத்தால் துல்லியமான செய்தியைச் சேமித்து, coding agent-ஐச் சோதிக்கும் முன் அதைத் தீர்க்கவும். வெற்றிகரமான பதில் இந்த உள்ளூர் inference பாதை ஒரு கோரிக்கைக்குப் பதிலளிக்க முடியும் என்பதையே உறுதிசெய்கிறது; மாடல் பாதுகாப்பாக code திருத்தும் என்பதை அல்ல.

படி 3: agent-ஐ இணைக்கும் முன் சரிபார்க்கவும்

முதல் மதிப்பீட்டை செயலில் உள்ள திட்டத்திலிருந்து தனியாக வைத்திருங்கள். தெரிந்த சிறிய பணியுள்ள தற்காலிக களஞ்சியத்தைப் பயன்படுத்தி, மாடல் artifact மற்றும் quantization, llama.cpp பதிப்பு, operating system, context அமைப்பு, prompt, output, எடுத்த நேரம், வளப் பயன்பாடு ஆகியவற்றைப் பதிவு செய்யுங்கள். வரையறுக்கப்பட்ட மாற்றத்தைக் கோரி, முன்மொழியப்பட்ட diff-ஐப் பார்த்து, களஞ்சியத்தின் ஏற்கனவே உள்ள சோதனைகளை நீங்களே இயக்கவும். ஒப்பீடு வேண்டுமெனில் அதே பணியை தற்போதைய baseline-இலும் செய்யவும். ஒரு prompt அல்லது ஒரு வெற்றிகரமான test run benchmark அல்ல.

மாடல் சேவையகம் text-ஐத் திருப்பித் தரும்; runtime மற்றும் கோரிக்கை வடிவத்தைப் பொறுத்து கட்டமைக்கப்பட்ட tool-call workflow-களையும் ஆதரிக்கலாம். agent எந்த tools-ஐப் பயன்படுத்தலாம் என அது தானாக முடிவுசெய்யாது, அவற்றைப் பாதுகாப்பாக இயக்கவும் செய்யாது. சூழலில் உள்ள agent களஞ்சிய அணுகல், shell கட்டளைகள், கோப்பு திருத்தங்கள், சோதனை இயக்கம் ஆகியவற்றைக் கட்டுப்படுத்துகிறது. முதலில் read-only அல்லது கடுமையாக வரையறுக்கப்பட்ட அணுகலைத் தரவும்; எழுதுதல், கட்டளைகளுக்கு ஒப்புதல் கோரவும்; ஒவ்வொரு diff-ஐயும் பரிசீலிக்கவும்; ரகசியங்களைச் சோதனைக் களஞ்சியத்திலும் prompt-களிலும் வைக்க வேண்டாம். agent பணியை மீறினாலோ, தொடர்பில்லாத கோப்புகளை மாற்றினாலோ, தோல்வியடைந்த சோதனையை விளக்க முடியாவிட்டாலோ நிறுத்தவும்.

தனிப்பட்ட பயன்பாட்டுக்கு inference எங்கு நடக்கிறது, agent எவ்வாறு அமைக்கப்பட்டுள்ளது என்பதை உறுதிப்படுத்தவும். கோரிக்கைகள் உள்ளூர் endpoint-இல் இருந்தால் உள்ளூர் மாடல் செயல்முறை prompt-களை உங்கள் கணினியிலேயே வைத்திருக்கலாம்; பிற அம்சங்களுக்கு agent வெளிப்புற சேவைகளை அழைக்கக்கூடும். தனிப்பட்ட code அல்லது data பயன்படுத்தும் முன் அந்தப் பயன்பாட்டின் network அணுகல், logs, telemetry, tool அனுமதிகளைச் சரிபார்க்கவும்.

படி 4: வெளியிடப்பட்ட ஆதாரம் எதை காட்டுகிறது, எதை காட்டவில்லை

Mellum2.1-ஐ 12B mixture-of-experts மாடலாக JetBrains விவரிக்கிறது; 2.5B செயலில் உள்ள அளவுருக்கள், BF16 precision, 131,072-token context ஆகியவை உள்ளன. Apache 2.0 உரிமத்தின் கீழ் வெளியிடப்பட்டதாகவும் sandboxed software சூழல்களில் reinforcement learning உள்ளிட்ட post-training நடந்ததாகவும் மாடல் அட்டை கூறுகிறது. agentic coding மதிப்பீடுகள் உட்பட benchmark முடிவுகளையும் JetBrains வெளியிடுகிறது. அவை JetBrains தானே அறிவித்த மதிப்பெண்கள்; BIG CHANGE அளவீடுகள் அல்ல, உங்கள் வன்பொருளின் throughput அல்லது திட்ட முடிவுகளையும் கணிக்காது.

வெளியீட்டு இடங்களுக்கு இடையில் வெளியீட்டின் ஒரு விவரம் மாறியது. அக்டோபர் 8 JetBrains launch பதிவில் GGUF builds “விரைவில் வரும்” எனக் கூறப்பட்டது. அக்டோபர் 9 அன்று அதிகாரப்பூர்வ Hugging Face GGUF களஞ்சியம் அணுகக்கூடியதாகி, llama.cpp, Ollama உள்ளிட்டவற்றுக்கான quickstart-களை கொண்டுள்ளது. இந்த வழிகாட்டி தற்போது வெளியிடப்பட்டுள்ள GGUF களஞ்சியத்தைப் பயன்படுத்துகிறது. BF16 களஞ்சியம் தனி artifact-ஆகவே உள்ளது; இந்நடவடிக்கைகளை மீண்டும் செய்வதற்கு முன் இரு களஞ்சியங்களிலும் மாற்றங்கள் உள்ளனவா எனப் பாருங்கள்.

பெரிய மாற்றம்

quantized Mellum2.1 build-க்கான வெளியிடப்பட்ட llama.cpp quickstart-ஐ இப்போது பின்பற்றி, உள்ளூர் OpenAI-இணக்கமான endpoint வழியாகக் கேள்வி கேட்கலாம். BF16 களஞ்சியத்திற்கான inference-provider deployment-ஐச் சாராமல், self-hosted inference-ஐ முதன்முறையாகச் சோதிப்பதை இது நடைமுறைப்படுத்துகிறது. பதில் serving பாதை செயல்படுகிறது என்பதை நிரூபிக்கும்; agent தரம், பொருத்தம், முழு toolchain-இன் தனியுரிமை அல்லது production தயார்நிலையை அல்ல.

ஆதாரங்களும் மேலும் வாசிப்பும்