Grok 4.7, 2026 செப்டம்பர் 21 அன்று அறிமுகமானது. குறியீடு எழுதவோ வணிகத் தகவலைப் பகுப்பாய்வு செய்யவோ AI-ஐ வாங்கும் குழுக்களுக்கு, மேம்பட்ட மாதிரி முடித்த வேலையை மலிவாக்குகிறதா என்ற நடைமுறைக் கேள்வியை அதன் வெளியீடு எழுப்புகிறது. பதில், விளம்பரப்படுத்தப்பட்ட டோக்கன் கட்டணத்தைவிட அதிகமானவற்றைப் பொறுத்தது. அதிகாரபூர்வ வெளியீட்டுக் குறிப்புகள்

இந்தக் கலவையான படமே செப்டம்பர் 22 அன்று வெளியான Matthew Berman-இன் காணொளியின் தலைப்பு: Grok 4.7 பற்றி என்ன நினைப்பது என்று தெரியவில்லை…. ஒப்பீட்டுத் தேர்வுகளை அவர் கேள்விக்குட்படுத்தி, டோக்கன் விலையைவிட முடிக்கப்பட்ட ஒரு பணிக்கான செலவே முக்கியம் என வாதிடுகிறார். மாதிரியை இன்னும் முழுமையாகச் சோதிக்கவில்லை என்றும் கூறுகிறார். ஆதாரங்களின் தொடக்கநிலை மதிப்பீடுதான் அவரது காணொளி; விரிவான நேரடி மதிப்பீடு அல்ல. Berman-இன் அறிமுகம், 0:00

பயனுள்ள மாதிரி ஒவ்வொரு அளவுகோலிலும் வெல்ல வேண்டியதில்லை; வணிகங்கள் தானியக்கமாக்கக்கூடிய பணிகளின் செலவை மாற்றினாலே கவனம் பெறும் என்பதற்காக இந்த அறிமுகம் முக்கியம். இருப்பினும், மொத்தச் செலவை நியாயப்படுத்த, போதுமான வேலையைச் சரியாக முடிக்க வேண்டும். சுயாதீனச் சோதனைகள் ஏற்கெனவே உள்ள பதற்றத்தை வெளிப்படுத்துகின்றன: Grok 4.7-இன் மேம்பட்ட முடிவுகளுக்கு மிகவும் அதிகமான வெளியீடு தேவைப்படலாம்.

உருவாக்குநர்கள், சிறு வணிகங்கள், முகவர்களை உருவாக்கும் குழுக்கள் ஆகியவற்றுக்கு முடிவு நடைமுறையானது. இந்த மாதிரி ஏற்றுக்கொள்ளத்தக்க தரத்தில் எந்தப் பணிகளை முடிக்க முடியும்? அதற்கு எவ்வளவு முயற்சி தேவை? முடித்துவிட்டதாக மாதிரி கூறிய பிறகும் ஒருவர் எவ்வளவு வேலை செய்ய வேண்டும்?

Berman-இன் சுமார் 17 நிமிடக் காணொளியின் முழு வசனங்களையும் மதிப்பாய்வு செய்து, அறிமுகம், தயாரிப்பு ஆவணம், Artificial Analysis-இன் மதிப்பீடு ஆகியவற்றைச் சரிபார்த்தோம். கீழேயுள்ள பகுப்பாய்வில் BIG CHANGE அளவுகோல்களோ Grok-ஐ நேரடியாகச் சோதித்தோம் என்ற கூற்றோ இல்லை.

என்ன அறிமுகமானது, எங்கே கிடைக்கிறது

தரநிலை மாதிரி xAI API-யில் கிடைக்கிறது; grok-4.7Cursor மற்றும் Grok Build-லும் கிடைக்கிறது. API உரையையும் படங்களையும் ஏற்று, உரையை வெளியிடுகிறது. ஆவணப்படுத்தப்பட்ட சூழல் சாளரம் 500,000 டோக்கன்கள்; குறைவு, நடுத்தரம், உயர்வு, xhigh என நான்கு பகுத்தறிவு அமைப்புகள் உள்ளன. உயர்வே இயல்புநிலை. அதிகாரபூர்வ வெளியீட்டுக் குறிப்புகள்

பெரிய அடிப்படை மாதிரியும் கடினமான பணிகளில் நீண்ட வலுவூட்டல் கற்றலும் மேம்பாட்டுக்குக் காரணம் என SpaceXAI கூறுகிறது. இது உருவாக்குநரின் விளக்கம். அறிமுகத்தின் தொழில்நுட்ப மேலோட்டம்

Grok 4.7 Fast என்ற பதிப்பும் உள்ளது. வேகமான உள்கட்டமைப்பில் இயங்கும் அதே மாதிரி என ஆவணம் விவரிக்கிறது; வழக்கமான டோக்கன் கட்டணத்தின் இருமடங்கு விலை நிர்ணயிக்கப்பட்டுள்ளது. Cursor மற்றும் Grok Build வழியாக வழங்கப்படுகிறது; Grok Build-இன் இலவசத் திட்டத்தில் சேர்க்கப்படவில்லை; பொதுவான xAI API வழியாகக் கிடைக்காது. Grok 4.7 தயாரிப்பு ஆவணம்

திரைப்பிடிப்புகள், செயல்விளக்கங்கள், கட்டணக் கணக்குகள் ஆகியவற்றை ஒப்பிடும்போது இந்த வேறுபாடுகள் முக்கியம். மாதிரிப் பதிப்பு, பகுத்தறிவு முயற்சி, வழங்கும் நிலை ஆகியவை தனித்தனி தேர்வுகள். xhigh-இல் இயங்கும் Fast செயல்விளக்கம், வழக்கமான வேகத்திலான நடுத்தர முயற்சி API அழைப்பின் அனுபவத்தையோ செலவையோ மதிப்பிடாது.

அறிமுகப் பக்கத்தில் உள்ள பிற மாதிரிகளுடனான ஒப்பீட்டையும் மேம்படுத்துப் பதிப்புடனான ஒப்பீட்டையும் தனித்தனியாகவே பார்க்க வேண்டும். தரநிலை Grok 4.7, Grok 4.6-இன் விலையும் வேகமும் கொண்டதே என SpaceXAI கூறுகிறது. 4.6-இலிருந்து மேம்படுத்தினால் வாடிக்கையாளரின் கட்டணம் தானாகப் பாதியாகும் என்று அது கூறவில்லை.

விலை அட்டையில் நீண்ட-சூழல் வரம்பு உள்ளது

வெளியிடப்பட்ட தரநிலை API கட்டணங்கள்:

  • 200,000 கேள்வித் டோக்கன்கள் வரை: ஒரு மில்லியன் டோக்கனுக்கு உள்ளீடு $2, தற்காலிகச் சேமிப்பிலுள்ள உள்ளீடு $0.50, வெளியீடு $6.
  • 200,000 கேள்வித் டோக்கன்களுக்கு மேல்: ஒரு மில்லியன் டோக்கனுக்கு உள்ளீடு $4, தற்காலிகச் சேமிப்பிலுள்ள உள்ளீடு $1, வெளியீடு $12.

ஒரு பணியை முடிக்கும் முகவருக்கான முழுச் செலவல்ல இவை; டோக்கன் கட்டணங்கள் மட்டுமே. 200,000 டோக்கன்களைத் தாண்டும் கோரிக்கைகளுக்கு அதிக விலை பொருந்தும் என மாதிரிப் பக்கம் குறிப்பிடுகிறது; உயர்ந்த கட்டணங்களை வெளியீட்டுக் குறிப்புகளும் தெரிவிக்கின்றன. விலையும் கிடைப்பும் செப்டம்பர் 22 அன்று சரிபார்க்கப்பட்டன. மாதிரி விலை நிர்ணயம் மற்றும் வெளியீட்டுக் குறிப்புகள்

எனவே, 500,000 டோக்கன் சூழல் சாளரம் இருந்தாலும், அதற்குள் வரும் ஒவ்வொரு கோரிக்கைக்கும் குறைந்த கட்டணமே பொருந்தும் என்று பொருளல்ல. பெருமளவிலான கோப்புகளில் தொடர்புடைய ஒவ்வொரு விவரத்தையும் மாதிரி தொடர்ந்து கண்டுபிடிக்கும் என்பதைப் பெரிய சூழல் சாளரமும் நிறுவாது.

Cursor-இல் தயாரிப்பு நிலை சார்ந்த இன்னொரு வேறுபாடு உள்ளது: தரநிலைச் சூழல் சாளரம் 256,000 டோக்கன்கள்; அதிகபட்சம் 500,000 என்று அதன் ஆவணம் குறிப்பிடுகிறது. தொகுப்பியில் கிடைக்கும் திறன் API விவரக்குறிப்பிலிருந்து வேறுபடலாம் அல்லது தேர்ந்தெடுத்த முறையைப் பொறுத்திருக்கலாம். Cursor-இன் Grok 4.7 ஆவணம்

நீண்ட அறிக்கைகளைச் செயலாக்கும் குழுவுக்கு, முழுப் பொருளையும் அனுப்புவது செலவை நியாயப்படுத்தும் அளவுக்கு முடிவை மேம்படுத்துகிறதா என்பதே உடனடிக் கேள்வி. தொடர்புடைய பகுதிகளை மட்டும் மீட்டெடுப்பது மலிவாகவும் ஆராய எளிதாகவும் இருக்கலாம். சில நேரங்களில் முழு ஆவணம் தேவை; வேறு நேரங்களில் அது கேள்வியை அமைப்பதற்கான எளிய வழி மட்டுமே. இவ்விரு நிலைகளையும் ஒரே வரவுசெலவாகக் கணக்கிடக் கூடாது.

சிறந்த செயல்திறனுக்கு அதிக டோக்கன்கள் தேவைப்படலாம்

செப்டம்பர் 21 அன்று வெளியான Artificial Analysis மதிப்பீட்டில், xhigh அமைப்பிலுள்ள Grok 4.7, அதன் Intelligence Index-இல் 46 மதிப்பெண் பெற்றுள்ளது; Grok 4.6-ஐவிட இரண்டு புள்ளிகள் அதிகம். ஒரு பணிக்குச் சுமார் 81,000 வெளியீட்டு டோக்கன்கள் தேவைப்பட்டதாகவும், உயர்ந்த முயற்சியில் Grok 4.6-க்கு 36,000 தேவைப்பட்டதாகவும் அது தெரிவிக்கிறது. அதே முயற்சி அளவிலான ஒப்பீட்டிலும், xhigh அமைப்பிலுள்ள Grok 4.6-க்கு 38,000 என அறிக்கை கூறுகிறது; அதாவது வெளியீட்டு டோக்கன்கள் இருமடங்குக்கும் அதிகம். Artificial Analysis-இன் அறிமுக மதிப்பீடு

டோக்கன் விலையையும் பணிச் செலவையும் தனித்தனியாகப் பார்ப்பதற்கான தெளிவான காரணம் இது. அடிப்படை மில்லியன்-டோக்கன் விலையான $6-இல் 81,000 வெளியீட்டுத் டோக்கன்கள் எடுத்துக்காட்டாக $0.486 செலவாகும். 38,000 டோக்கன்களுக்கு அது $0.228 ஆகும். உள்ளீடு, தற்காலிகச் சேமிப்பு முறை, கருவிக் கட்டணம், உயர்ந்த சூழல் விலை, தோல்வியடைந்த முயற்சிகள் ஆகியவற்றை இந்தக் கணக்குகள் நோக்கமுடன் விலக்குகின்றன. அறிவிக்கப்பட்ட டோக்கன் எண்ணிக்கையைப் பயன்படுத்திய கணிதம் இவை; பணிக்கான அளவிடப்பட்ட முழுச் செலவுகள் அல்ல.

அதிக வெளியீடு என்றாலே வீணாக்கம் என்று பொருளல்ல. கூடுதல் முயற்சியுடன் பதிலைச் சரிபார்த்து, இல்லாவிட்டால் ஒருவர் தலையிட வேண்டிய தோல்வியை மாதிரி தவிர்க்கலாம். தவறான அணுகுமுறையை நீண்ட நேரம் பின்தொடரவும் கூடும். பயனுள்ள விடாமுயற்சியையும் செலவான மீள்முயற்சியையும் டோக்கன் எண்ணிக்கை மட்டும் வேறுபடுத்தாது.

காணொளியின் இறுதிப் பகுதியில் Berman மீண்டும் இந்தப் பிரச்சினையைப் பேசுகிறார்; Artificial Analysis தெரிவித்த அதிக டோக்கன் பயன்பாட்டைக் குறிப்பிடுகிறார். காணொளி, 15:43

ஏற்றுக்கொள்ளப்பட்ட வழங்கப்பட வேண்டிய பொருளே பயனுள்ள முடிவு. பொருத்தமான சோதனைகளிலும் மதிப்பாய்விலும் தேறும் குறியீட்டு மாற்றம், சூத்திரங்கள் ஒன்றோடொன்று பொருந்தும் விரிதாள், ஆதாரத்துடன் தொடர்புபடுத்தக்கூடிய கூற்றுகளுள்ள அறிக்கை ஆகியவை, விரைவாக வந்த பதிலைவிட வேறுபட்ட மதிப்பைக் கொண்டவை.

அளவுகோல்கள் திறமையானதாயினும் சீரற்ற மாதிரியைக் காட்டுகின்றன

அறிமுக அட்டவணையில், CursorBench 4.0-இல் Grok 4.7 xhigh 46.3% பெற்றுள்ளது; Fable 5.1 max-இன் 51.8%-க்குக் கீழ். Terminal-Bench ஒப்பீட்டிலும் Fable முன்னிலை வகிக்கிறது. விற்பனையாளர் அளவுகோல் அட்டவணை

உடன் வந்த விளக்கப்படம், அளவுகோல் மதிப்பெண்ணையும் வெளியீட்டு டோக்கன்களையும் ஒப்பிடுகிறது; வலப்பக்கம் செல்லச் செல்ல டோக்கன்கள் குறைகின்றன. அதன் கோடுகள் பகுத்தறிவு அமைப்புகளை ஒப்பிடுகின்றன. அசல் ஊடாடும் விளக்கப்படம்: “Tokens” என்பதைத் தேர்ந்தெடுக்கவும். முழு அளவிலான விளக்கப்படத்தைத் திறக்கவும்.

Line chart comparing Grok 4.7, Fable 5.1, Opus 5, GPT-5.6 Sol and Sonnet 5: CursorBench 4.0 score versus average output tokens per task, with fewer tokens to the right.
Source: SpaceXAI’s Grok 4.7 launch chart, September 21, 2026. CursorBench 4.0 score versus average output tokens per task across reasoning-effort settings; the horizontal axis runs from 150,000 on the left to zero on the right. Vendor-published benchmark; token use alone is not total task cost.

மேலே செல்வது அதிக மதிப்பெண்ணையும் வலப்புறம் செல்வது இந்த மதிப்பீட்டில் குறைவான உருவாக்கப்பட்ட டோக்கன்களையும் குறிக்கிறது. மொத்தக் கட்டணம் குறைவு என்று இதனால் பொருளல்ல: டோக்கன் கட்டணம், உள்ளீட்டுப் பயன்பாடு, சுற்றியுள்ள முகவர் ஆகியவையும் முக்கியம். மேலே கூறிய Artificial Analysis டோக்கன் எண்ணிக்கைகளிலிருந்து இதுவும் வேறுபட்ட சோதனை. இரண்டின் எண்ணிக்கைகளையும் ஒன்றாக்கினால், ஒவ்வொரு முடிவையும் புரிந்துகொள்ள உதவும் பணி மற்றும் முறையியல் வேறுபாடுகள் அழிந்துவிடும்.

எல்லா வகை குறியீட்டுப் பணிகளிலும் Grok 4.7 முன்னிலை வகிக்கிறது என்ற பொதுவான கூற்றை நிராகரிக்க இதுவே போதும். குறிப்பிட்ட பணிச்சுமைகளுக்கு நெருக்கமாக ஆராய்வதற்கான காரணமும் இதுவே. ஒரு மதிப்பீட்டில் கிடைத்த மேம்பாட்டின் அளவு, அறிமுகமில்லாத குறியீட்டுத் தொகுதி, முழுமையற்ற பிழை அறிக்கை அல்லது வழக்கத்திற்கு மாறான கருவிச் சூழலை மாதிரி எப்படிக் கையாளும் என்பதைத் தீர்மானிக்காது.

Artificial Analysis பயனுள்ள சுயாதீன வேறுபாட்டைக் காட்டுகிறது. Grok Build உடனான Grok 4.7-க்கு அதன் Coding Agent Index-இல் 56 மதிப்பெண் கிடைத்ததாகவும், அதே முகவருடன் Grok 4.6 பெற்ற 47-ஐவிட உயர்ந்ததாகவும் அறிக்கை கூறுகிறது. இந்தத் தனிப்பட்ட முகவர் முடிவுகளை, தரப்படுத்தப்பட்ட Intelligence Index அமைப்பிலிருந்து அது வெளிப்படையாகப் பிரிக்கிறது. சுயாதீன மதிப்பீடும் முறையியல் குறிப்புகளும்

சுற்றியுள்ள முகவரும் முக்கியம். அது கருவிகளை வழங்கி, சூழலை நிர்வகித்து, மாதிரியின் கோரிக்கைகள் எப்படிச் செயல்படுத்தப்படுகின்றன என்பதைத் தீர்மானிக்கிறது. மாதிரியின் பெயர் அதே இருந்தாலும் அந்தச் சூழலை மாற்றினால் முடிவுகளும் மாறலாம். ஒரு அமைப்பின் முனைய மதிப்பெண்ணையும் மற்றொரு அமைப்பின் மென்பொருள் பொறியியல் மதிப்பெண்ணையும் இணைத்தால், யாரும் உண்மையில் சோதிக்காத அமைப்பை விவரிக்கும் நம்பத்தகுந்த அட்டவணை உருவாகலாம்.

ஒரு வெளியீட்டு அட்டவணையில் GPT-6 Astra இல்லாததை Berman சுட்டிக்காட்டி, AI உருவாக்கிய மறுகட்டமைப்பைப் பயன்படுத்தி அதைச் சேர்க்கிறார். ஒப்பீட்டை ஆராய்வதற்கான தூண்டுதலாக இது பயனுள்ளது; அந்த மறுகட்டமைப்பு சுயாதீன அளவுகோல் ஆதாரமல்ல. அடிப்படை மதிப்பீட்டைச் சரிபார்க்காமல் சேர்க்கப்பட்ட எண்களை நாங்கள் ஏற்கவில்லை. காணொளி, 6:03

கவனத்தில் கொள்ள வேண்டிய வணிகத் தொடர்பும் உள்ளது. Cursor-ஐ SpaceX வாங்கியதாக ஆகஸ்ட் 14 நிறுவன அறிவிப்பு கூறுகிறது. அதே நிறுவனக் குடும்பத்துக்குள் வெளியிடப்பட்ட அளவுகோல் இன்னும் பயனுள்ள ஆதாரம்; ஆனால் போட்டியாளர் வழங்குநரைப் பற்றிய விருப்பமற்ற மதிப்பீடு அல்ல. Cursor கையகப்படுத்தல் அறிவிப்பு

அலுவலகப் பணி இன்னும் சுவாரசியமான வாய்ப்பாக இருக்கலாம்

Grok 4.7 xhigh-க்கு AA-Briefcase-இல் 1,657 Elo மதிப்பெண் கிடைத்ததாகவும், உயர்ந்த முயற்சியிலிருந்த Grok 4.6-ஐவிட 111 அதிகம் என்றும் சுயாதீன மதிப்பீடு தெரிவிக்கிறது. மேம்பாட்டின் பெரும்பகுதி பகுப்பாய்வுத் தரத்தால் ஏற்பட்டதாக அது கூறுகிறது; ஆனால் வழங்கல் தரம் முந்தைய மாதிரியின் முடிவைவிடச் சற்றுக் குறைவு. அறிவுசார் பணிகள் குறித்த Artificial Analysis முடிவுகள்

அறிக்கைகள், விரிதாள்கள், விளக்கக்காட்சிகளைப் பணியாக ஒப்படைக்கும் அனைவருக்கும் இந்தப் பிரிவு பயனுள்ளது. பதிலில் சிறந்த பகுப்பாய்வு இருந்தாலும், திருத்தமோ மறுவடிவமைப்போ தேவைப்படலாம். மெருகூட்டப்பட்ட விளக்கக்காட்சி ஆழமற்ற பகுத்தறிவை மறைக்கலாம். வெளியில் தெரியும் முடிவை மட்டும் மதிப்பிட்டால், தவறான மேம்பாட்டுக்குப் பரிசளிக்கும் அபாயம் உண்டு.

செயல்பாட்டுக் குழு, மீண்டும் மீண்டும் தயாரிக்கும் செயல்திறன் அறிக்கையில் மாதிரியைச் சோதிக்கலாம். அது சரியான காலப்பகுதியைப் பயன்படுத்துகிறதா, மூலத் தரவுடன் எண்களை ஒப்பிட்டு சரிபார்க்கிறதா, கவனிக்கப்பட்ட மாற்றத்தையும் முன்மொழியப்பட்ட விளக்கத்தையும் வேறுபடுத்துகிறதா என்பதைச் சோதனை பார்க்க வேண்டும். முதல் பார்வைக்கு அறிக்கை தொழில்முறையாகத் தெரிந்ததா என்பதோடு மட்டும் நிற்காமல், எவ்வளவு திருத்தம் தேவைப்பட்டது என்பதையும் மதிப்பாய்வாளர் பதிவு செய்ய வேண்டும்.

மிகக் கடினமான அளவுகோலில் வெல்வதைவிட, இல்லாவிட்டால் கட்டுப்படியாகாத பகுப்பாய்வை வழக்கமாகச் செய்வதே சிறு வணிகத்துக்கு முக்கியமாக இருக்கலாம். பரந்த தத்தெடுப்புக்கான சாத்தியமான பாதை அது. வெளியீடு துல்லியமாகவும் சரியான நேரத்திலும் வந்து, உரிமையாளர் கைமுறையாகச் செய்வதைவிடக் குறைந்த வேலையை விட்டுச் செல்லும்போது அது நனவாகிறது.

தொழில்முறை அளவுகோல் பெயர்களைத் தொழில்முறைத் தகுதிகளாகத் தவறாகக் கருதக்கூடாது. சட்டப் பணி அல்லது மருத்துவப் பகுத்தறிவு முடிவு, அந்த மதிப்பீட்டில் கிடைத்த செயல்திறனை விவரிக்கிறது. வாடிக்கையாளரின் சட்டச் சிக்கலைத் தன்னிச்சையாகக் கையாளவோ நோயாளிப் பராமரிப்பு முடிவெடுக்கவோ மாதிரி தகுதிபெற்றது என்பதை அது நிறுவாது. அத்தகைய முடிவுகளுக்கு Grok-ஐப் பயன்படுத்த இந்தக் கட்டுரை பரிந்துரைக்கவில்லை.

பாதுகாப்பு அம்சங்களையும் சூழலுடன் மதிப்பிட வேண்டும்

புதிய பாதுகாப்பு அடுக்குத் தொகுப்பும், ஜெயில்பிரேக் முயற்சிகளுக்கு மேம்பட்ட எதிர்ப்புத்திறனும் Grok 4.7-இல் உள்ளதாக SpaceXAI கூறுகிறது. இது அறிமுகக் கூற்று; அந்த மாதிரியைப் பயன்படுத்தும் ஒவ்வொரு செயலியும் பாதுகாப்பானது என்ற உத்தரவாதமல்ல. உருவாக்குநரின் பாதுகாப்பு விளக்கம்

வணிக முகவருக்கு குறைந்தது இரண்டு கேள்விகள் எஞ்சுகின்றன. பெறும் கோரிக்கைகளுக்கு மாதிரி பொருத்தமாகப் பதிலளிக்கிறதா? மாதிரியால் உண்மையில் என்ன செய்ய முடியும் என்பதைச் செயலி கட்டுப்படுத்துகிறதா?

வாடிக்கையாளர் பதிவை மாற்ற வேண்டும் என்ற அறிவுறுத்தலை மாதிரி சரியாகப் புரிந்துகொண்டாலும், அந்த மாற்றத்தைச் செய்ய அதற்கு அனுமதி இல்லாமல் இருக்கலாம். சுருக்கமளிக்க வேண்டிய ஆவணத்தில் பதிக்கப்பட்ட தீங்கிழைக்கும் அறிவுறுத்தல்களையும் அது சந்திக்கலாம். அணுகல் கட்டுப்பாடுகளும் ஒப்புதல் விதிகளும் சுற்றியுள்ள அமைப்பின் பகுதியாகவே இருக்க வேண்டும்; மறுப்பு நடத்தையில் ஏற்படும் மேம்பாடு அவற்றுக்குப் பதிலாகாது.

முழுப் பணிப்பாய்வையும் சோதிக்க வேண்டும் என்பதே நடைமுறை விளைவு. வெற்றிபெற வேண்டிய நியாயமான கோரிக்கைகள், தடுக்கப்பட வேண்டிய அனுமதியற்ற செயல்கள், விளக்கம் கேட்டு நிறுத்தப்பட வேண்டிய தெளிவற்ற நிலைகள் ஆகியவற்றைச் சேர்க்கவும். பாதிப்பில்லாத வேலையை அடிக்கடி மறுக்கும் தயாரிப்பு பயன்படுத்த முடியாததாகலாம்; அனுமதியற்ற செயல்களைச் செய்யும் ஒன்று அதைவிட மோசமாக இருக்கலாம். ஒற்றைத் தலைப்புச் செய்தி மதிப்பெண் இந்த இரு சிக்கல்களையும் காட்டாது.

காணொளி தீர்க்காமல் விட்டவை

கேள்விகளாகவே இருக்க வேண்டிய பல கேள்விகளை Berman-இன் கண்ணோட்டம் எழுப்புகிறது. விலையை கிடைக்கக்கூடிய கணினித் திறனுடன் இணைக்கும் அவரது விளக்கம் சந்தை குறித்த பொருளாக்கம்; வெளியிடப்பட்ட அலகுச் செலவுக் கணக்கல்ல. அவர் விவாதிக்கும் சமூக ஊடகக் கணிப்புகள், வழங்கப்பட்ட செயல்திறனுக்கான ஆதாரம் அல்ல; எதிர்பார்ப்புகளே. இறுதி செயல்விளக்க ஒப்பீட்டில் பயன்படுத்திய அமைப்புகள் என்னவென்று தனக்குத் தெரியாது என்பதையும் அவர் ஒப்புக்கொள்கிறார். விலை விவாதம், 8:44, எதிர்பார்ப்புகள், 11:51 மற்றும் செயல்விளக்க விவாதம், 15:20

திறந்த எடை மாதிரிகளையும் காணொளி விவாதிக்கிறது. அந்தப் பரந்த போட்டிப் போக்கை Grok 4.7-இன் உரிம நிபந்தனைகளுடன் குழப்பக் கூடாது: இந்த வெளியீடு தனியுரிமை கொண்டது என்றும் அதன் எடைகள் கிடைக்கவில்லை என்றும் Artificial Analysis குறிப்பிடுகிறது. Grok 4.7 வெளியீட்டுச் சுயவிவரம்

இந்த வேறுபாடுகள் மதிப்பீட்டை மையப்படுத்துகின்றன. வழங்குநர் ஏன் அந்த விலையைத் தேர்ந்தெடுத்தார் என்பதைப் பொதுமக்கள் அறியாவிட்டாலும், தயாரிப்புக்கு ஈர்க்கக்கூடிய விலை இருக்கலாம். தோல்வியடைந்த வியப்பூட்டும் செயல்விளக்கம், மீண்டும் செய்ய வேண்டிய ஒரு சோதனையைச் சுட்டலாம்; மாதிரி பொதுவாக மோசமானது என்பதை நிறுவாது. நிறுவனரின் முந்தைய கணிப்பை எட்டாவிட்டாலும் கிடைக்கும் மாதிரி பயனுள்ளதாக இருக்கலாம்.

விளம்பர ஆதரவுக்கும் ஒரு எல்லை உண்டு. Berman-இன் காணொளியில் Zapier விளம்பரம் இடம்பெறுகிறது. அது Grok செயல்திறனுக்கான சுயாதீன ஆதாரமல்ல; அதிலுள்ள விளம்பரக் கூற்றுகள் BIG CHANGE-இன் பரிந்துரைகளும் அல்ல.

சிறந்த கொள்முதல் அளவுகோல்: ஏற்றுக்கொள்ளப்பட்ட ஒவ்வொரு பணிக்கான செலவு

Sketch of a task passing through model work and validation to delivery, with a retry arrow returning from validation to model work.
AI-generated conceptual illustration by BIG CHANGE. Task → model work → validation → delivery. Retries add to the time and cost of the accepted result; this is an illustrative workflow.

Grok 4.7-ஐப் பரிசீலிக்கும் குழு, சிறியதாயினும் வழக்கமான பணிகளைக் குறிக்கும் தொகுப்பில் தங்கள் தற்போதைய செயல்முறையுடன் ஒப்பிட வேண்டும். வெளியீடுகளைப் பார்ப்பதற்கு முன்பே ஏற்றுக்கொள்ளும் நிபந்தனைகளை வரையறுக்க வேண்டும். குறியீட்டுக்கு, பொருத்தமான சோதனைகள், வாசிக்கக்கூடிய திருத்தத் தொகுப்பு, தொடர்பற்ற மாற்றங்கள் இல்லாமை ஆகியவை அந்த நிபந்தனைகளாக இருக்கலாம். பகுப்பாய்வுக்கு, சரியான கணக்கீடுகளும் முக்கியமான கூற்றுகளுக்கான ஆதாரமும் தேவைப்படலாம்.

பிறகு முழுக் கட்டணத்தையும் பதிவு செய்யுங்கள்: உள்ளீடு, வெளியீட்டுப் பயன்பாடு, கருவிகள், மீண்டும் முயற்சிகள், முடிவை மதிப்பாய்வு செய்யவோ திருத்தவோ செலவிட்ட நேரம். தோல்வியடைந்த முயற்சிகளையும் எண்ணுங்கள். அந்தச் செலவை ஏற்றுக்கொள்ளும் நிபந்தனைகளைப் பூர்த்தி செய்த வழங்கல்களின் எண்ணிக்கையால் வகுக்கவும்.

இந்த வேறுபாடு ஏன் முக்கியம் என்பதை ஓர் எடுத்துக்காட்டு காட்டுகிறது. ஒரு அமைப்பு ஒரு தொகுதியில் $20 செலவிட்டு ஏற்றுக்கொள்ளப்பட்ட 80 முடிவுகளை வழங்குகிறது எனக் கொள்வோம். மனித உழைப்புக்கு முன், ஏற்றுக்கொள்ளப்பட்ட ஒவ்வொரு முடிவுக்கும் அளவிடப்பட்ட செலவு $0.25. மற்றொன்று $12 செலவிட்டும் 30 முடிவுகள் மட்டுமே ஏற்றுக்கொள்ளப்பட்டால், ஒவ்வொன்றுக்கும் $0.40 ஆகும். மலிவான தொகுப்பு, பயன்படுத்தக்கூடிய வேலையின் அதிகச் செலவுள்ள மூலமாகிறது. இவை கற்பனை எண்கள்; Grok அளவீடுகள் அல்ல.

பகுத்தறிவு முயற்சியையும் அந்தச் சோதனையில் சேர்க்க வேண்டும். உயர் முயற்சி அமைப்பு கடினமான பணியில் அதன் செலவுக்குரிய மதிப்பைத் தரலாம்; வழக்கமான பணியில் அதிகம் சேர்க்காமல் போகலாம். ஒவ்வொரு கோரிக்கையையும் xhigh-இல் இயக்குவதைவிட, தேவைப்படும் வழக்குகளுக்கு மட்டும் உயர்த்துவது சிக்கனமாக இருக்கலாம்; ஆனால் பணிகளை வழிமாற்றும் முடிவையும் மதிப்பிட வேண்டும்.

மாதிரிகளுக்கிடையில் மதிப்பாய்வு தரநிலைகளை ஒரே மாதிரியாக வைத்திருங்கள். மலிவான மாதிரிக்கான அளவுகோலைக் குறைப்பது மோசமான வேலையை ஏற்றுக்கொள்வதன் மூலம் போலியான சேமிப்பை உருவாக்கும். தற்போதைய மாதிரிக்கே அதிகத் தரநிலையை விதிப்பது எதிர்மறையான சாய்வை உருவாக்கும். நம்பகமான முடிவை வாங்குவதும், மக்கள் இன்னும் செய்ய வேண்டியதைத் தெளிவாகக் கணக்கிடுவதுமே நோக்கம்.

கவனிக்க வேண்டிய மாற்றம்

Grok 4.7 குழுக்களுக்கு இன்னொரு சோதனைத் தேர்வை வழங்குகிறது. அதைத் தேர்வுசெய்ய, முழுப் பணியையும் கவனிக்க வேண்டும்: மாதிரி எதை உருவாக்குகிறது, எதைப் பயன்படுத்துகிறது, ஒருவர் இன்னும் எதைச் சரிசெய்ய வேண்டும்.

அன்றாடப் பணிகளில் AI-யின் தேர்ந்தெடுத்த பயன்பாடு அதிகரிப்பதே பரந்த விளைவாக இருக்கலாம். வழக்கமான பகுப்பாய்வுக்கு ஒரு அமைப்பையும், கடினமான குறியீட்டுப் பணிக்கு மற்றொன்றையும், தீர்ப்பையோ பொறுப்பேற்பையோ ஒப்படைக்க முடியாத சந்தர்ப்பங்களில் மனிதரையும் குழு தேர்ந்தெடுக்கலாம். அதிகப் போட்டி அந்தக் குழுவுக்குச் சோதிக்க இன்னொரு தேர்வைத் தருகிறது; எது வெல்ல வேண்டும் என்று கட்டளையிடாது.

BIG CHANGE-க்கு அடுத்த மைல்கல், குறைந்த மொத்த முயற்சியுடன் அளவிடக்கூடிய வேலையை முடிப்பதே. ஏற்றுக்கொள்ளப்பட்ட வழங்கல்களின் செலவை Grok 4.7 குறைத்தால், பயனுள்ள தானியக்கத்தை மேலும் பல நிறுவனங்களுக்கு அணுகக்கூடியதாக்கும். கூடுதல் பகுத்தறிவு, டோக்கன் விலையிலிருந்த செலவைப் பயன்படுத்தப்படும் டோக்கன்களின் அளவுக்குள் மட்டும் நகர்த்தினால், தலைப்பில் உள்ள விலை வாங்குபவர்களுக்கு மிகக் குறைவாகவே தெரிவிக்கும். முதலில் தோல்வியடைந்த பணிகள் உட்பட முடிந்த பணிகளிலிருந்தே அந்தக் கேள்விக்கான தீர்மான ஆதாரம் வரும்.