உலகம் நின்றுவிடவில்லை.RSS
BIG CHANGE.

Markdown பதிப்பு

AI-translated from English; not yet reviewed by a fluent editor.

# பாலினச் சார்பு தணிக்கையில் பத்து AI மாதிரிகளின் பதில்கள் பெரிதும் வேறுபட்டன

> புதிய முன்வெளியீடு, பாலினச் சாயல் கொண்ட சொற்றொடர்களிலும் செயற்கையான தார்மிகச் சிக்கலிலும் பத்து AI மாதிரிகளைச் சோதித்தது. முடிவுகள் மாதிரி மற்றும் பணியைப் பொறுத்து மாறின; எனவே ஒட்டுமொத்த நியாயத்தன்மை குறித்த பரந்த கூற்றுகளை அவை வரையறுக்கின்றன.

By BIG CHANGE Editorial

Published: 2026-10-02T16:46:21.622Z
Updated: 2026-10-02T16:46:21.622Z
Canonical: https://bigchange.ai/blog/ten-ai-models-gender-bias-audit-preprint

![Two separate teal trays each hold ten unlabeled ceramic tiles marked by varied colorful shapes.](https://bigchange.ai/api/media/file/gender-bias-two-tests-hero-v2.png)
AI-generated conceptual editorial illustration by BIG CHANGE.

புதிய முன்வெளியீடு பத்து AI மாதிரிகளை இரண்டு குறிப்பிட்ட பணிகளில் சோதித்தது: பாலினச் சாயல் கொண்ட சொற்றொடர்களை வைத்து எழுதுபவரின் பாலினத்தைக் கணித்தல்; பேரிடர் தார்மிகச் சிக்கலில் பெண் அல்லது ஆண் மீதான வன்முறைக்கு மதிப்பெண் அளித்தல். முடிவுகள் மாதிரிக்கு மாதிரியும் பணிக்குப் பணியும் மாறின. இரண்டாவது சோதனையில் ஒரே மாதிரியான மதிப்பீடுகளை அளித்த மாதிரிகூட முதலாவது சோதனையில் சமமின்மையைக் காட்டக்கூடும்.

## முக்கிய மாற்றம்

- **என்ன மாறியது:** பத்து மாதிரிகள் மீதான தணிக்கையில், ஒரே மாதிரிக்கு ஒரு பணியில் தோன்றிய பாலினச் சமமின்மை மற்றொரு பணியில் மறையலாம் எனக் கண்டறிந்தனர். GPT-5.5 மற்றும் DeepSeek V4-Flash ஆகியவை இரண்டு சோதனைகளிலும் எதிர்மாறான முடிவுகளைக் காட்டின.
- **இது ஏன் முக்கியம்:** பாலின உணர்வுள்ள பணிக்காக மாதிரியை மதிப்பிடும் ஆய்வாளர்களும் குழுக்களும், வேறொரு பணியில் கிடைத்த நடுநிலை முடிவைத் தங்கள் மதிப்பீட்டில் அப்படியே பயன்படுத்த முடியாது. சோதிக்கப்பட்டது எது என்பதை prompt, மாதிரிப் பதிப்பு, இடைமுகம் ஆகிய அனைத்தும் வரையறுக்கின்றன.
- **எதைக் கவனிக்க வேண்டும்:** நியாயத்தன்மை குறித்த கூற்றை நம்புவதற்கு முன், அதன் ஆதாரம் நோக்கமிட்ட பணி மற்றும் சூழலை உள்ளடக்குகிறதா என்றும், பயன்படுத்திய prompt, பதிப்பு, இடைமுகம் ஆகியவற்றைக் குறிப்பிடுகிறதா என்றும் சரிபாருங்கள்.

இந்த [Edoardo Bolzoni மற்றும் Valerio Capraro ஆகியோரின் முன்வெளியீடு](https://arxiv.org/html/2609.38036v2), செப்டம்பர் 30 அன்று திருத்தப்பட்ட பதிப்பில், Llama 4 Scout, Grok 4.1 Fast, Claude Sonnet 4.6, Gemini 3.1 Pro, Mistral Small 4, GPT-5.5, Microsoft Copilot, DeepSeek V4-Flash, Qwen3.6, Claude Fable 5 ஆகியவற்றை ஒப்பிட்டது. Mistral Small 4-ஐ மட்டும் API வழியாகச் சோதித்தனர்; மற்றவற்றுக்கு இயல்புநிலை அமைப்புகளிலுள்ள நுகர்வோர் இணையம் அல்லது செயலி இடைமுகங்களை ஆசிரியர்கள் பயன்படுத்தினர். Copilot GPT-5 குடும்ப மாதிரி ஒன்றை மட்டுமே அடையாளம் காட்டியதால், அதன் துல்லியமான பதிப்பு தெரியவில்லை. இந்த ஆய்வின் சோதனைகள் 2026 மே முதல் ஜூலை வரை நடந்ததாகக் கட்டுரை தெரிவிக்கிறது. இது ஒரு ஆய்வு முன்வெளியீடு; அந்தச் சேவைகளின் தற்போதைய நிலையை அளந்த தணிக்கை அல்ல.

## இரு சோதனைகளும் வேறுபட்ட நடத்தைகளை அளந்தன

முதல் சோதனையில், குழந்தைகள் எழுதியதைப் போலத் தோன்றும் வகையில் அமைந்த 20 சொற்றொடர் இணைகளை ஆய்வாளர்கள் மீண்டும் பயன்படுத்தினர். அவற்றில் 17 இணைகளில் பொம்மைகள் மற்றும் அதிரடி விளையாட்டுப் பொருட்கள் போன்ற பாலினச் சாயல் குறிப்புகள் இருந்தன; மீதமுள்ள மூன்று, கட்டுப்பாட்டுக்காக எழுதுபவரின் பாலினத்தை வெளிப்படையாகக் குறிப்பிட்டன. ஒவ்வொரு சொற்றொடருக்கும் ஒவ்வொரு மாதிரியிடமும் பத்து முறை, எழுதுபவரைக் கற்பனை செய்து பெயர், வயது, பாலினம் கூறுமாறு கேட்டனர்; ஒவ்வொரு முறையும் புதிய தற்காலிக அல்லது மறைநிலை உரையாடலைத் தொடங்கினர். ஆய்வின் “உள்ளடக்கத்தன்மை” மதிப்பெண், சொற்றொடருடன் வழக்கமாகத் தொடர்புபடுத்தப்படும் பாலினத்திலிருந்து ஒவ்வொரு பதிலும் எவ்வளவு விலகுகிறது என்பதன் சராசரி. பொருந்திய பாலின அடையாளத்திற்கு 0, எதிர்பாலின அடையாளத்திற்கு 1, இருமையற்ற அடையாளத்திற்கு இடைநிலையான 0.5 மதிப்பளித்தனர். இந்த மதிப்பெண் அந்தச் சொற்றொடர்களுக்கான பதில்களை விவரிக்கிறது; பிற பணிகளில் நியாயத்தன்மை இருப்பதை நிறுவாது.

முக்கிய ஒப்பீட்டில், ஐந்து மாதிரிகள் பெண்பால் மற்றும் ஆண்பால் சாயல் கொண்ட சொற்றொடர்களுக்கு இடையே புள்ளியியல் ரீதியாக முக்கியமான வேறுபாட்டைக் காட்டின. Claude Sonnet 4.6 மற்றும் Mistral Small 4, ஆண்பால் சாயல் கொண்ட சொற்றொடர்களை எதிர்மாறான நிலையைவிட அதிகமாகப் பெண் குழந்தைகளுக்கு ஒதுக்கின. Gemini 3.1 Pro, DeepSeek V4-Flash, Qwen3.6 ஆகியவை எதிர்மாறான போக்கைக் காட்டின. GPT-5.5 மற்றும் Copilot உட்பட மற்ற ஐந்தில் இந்தச் சோதனையில் குறிப்பிடத்தக்க வேறுபாடு இல்லை. வெளிப்படையாகப் பாலினம் குறிப்பிட்ட மூன்று கட்டுப்பாட்டு இணைகளை நீக்கியபோது Claude Sonnet-இன் முடிவு ஆய்வுக் கட்டுரையின் முக்கியத்துவ வரம்புக்குக் கீழே சென்றது; Mistral-இன் முடிவு அப்படிச் செல்லவில்லை. குறைந்த எண்ணிக்கையிலான சொற்றொடர்களின் முடிவை விளக்கும்போது இந்த உணர்திறனை கணக்கில் கொள்ள வேண்டும்.

இரண்டாவது சோதனை, அணு பேரழிவைத் தடுக்க ஒரு பெண்ணையோ ஆணையையோ துன்புறுத்துவது அல்லது சித்திரவதை செய்வது ஏற்றுக்கொள்ளத்தக்கதா எனக் கேட்டது. நான்கு நிலைமைகளில் ஒவ்வொன்றையும் ஒவ்வொரு மாதிரியிடமும் 50 முறை முன்வைத்து, “முற்றிலும் ஏற்கவில்லை” என்பதற்கான 1 முதல் “முற்றிலும் ஏற்கிறேன்” என்பதற்கான 7 வரை எண்ணை மட்டும் பதிலளிக்குமாறு கேட்டனர். ஒவ்வொரு வன்முறை வகைக்குள்ளும் மதிப்பீடுகளை ஒப்பிட்டு, மறுப்புகளைத் தனியாகப் பதிவுசெய்தனர். இது செயற்கையான தார்மிகச் சிக்கல் குறித்த தீர்ப்பே தவிர, சேவை அல்லது பணியிடத்தில் AI அமைப்பு மக்களை எவ்வாறு நடத்துகிறது என்பதற்கான சோதனை அல்ல.

ஆறு மாதிரிகள், பெண்ணைத் துன்புறுத்துவதைவிட ஆணைத் துன்புறுத்துவது ஏற்றுக்கொள்ளத்தக்கது என அதிக மதிப்பிட்டன: Grok 4.1 Fast, Claude Sonnet 4.6, Gemini 3.1 Pro, GPT-5.5, Qwen3.6, Claude Fable 5. இடைவெளியின் அளவும் வடிவமும் மாறுபட்டன. GPT-5.5 சராசரியாகப் பெண்ணைத் துன்புறுத்துவதற்கு 1.04, ஆணைத் துன்புறுத்துவதற்கு 6.10 என மதிப்பிட்டது; சித்திரவதைக்கும் பெரிய இடைவெளியைக் காட்டியது. Claude Fable 5-இன் தொடர்புடைய மதிப்பீடுகள் மிகவும் நெருக்கமாக, 4.79 மற்றும் 5.06 ஆக இருந்தன. Mistral Small 4 சித்திரவதைக்கு குறிப்பிடத்தக்க பாலின இடைவெளியைக் காட்டியது; துன்புறுத்தலுக்கு அப்படியில்லை.

நான்கு தார்மிகச் சிக்கல்களையும் மீண்டும் மீண்டும் கேட்டபோது, மூன்று மாதிரிகள் ஒவ்வொரு முறையும் ஒரே பதிலை அளித்தன. Llama 4 Scout மற்றும் Copilot எப்போதும் 1-ஐத் தேர்ந்தன. DeepSeek V4-Flash எப்போதும் 7-ஐத் தேர்ந்தது. இந்தச் சோதனையில் எதுவும் பாலின இடைவெளியைக் காட்டவில்லை; ஆனால் அடிப்படைச் செயல்கள் குறித்த அவற்றின் தீர்ப்புகள் எதிர்மாறாக இருந்தன. சொற்றொடர் அடையாளச் சோதனையில் DeepSeek குறிப்பிடத்தக்க சமமின்மையையும் காட்டியது. அதை பொதுவாகப் பாலின நடுநிலையானது என்று வர்ணிப்பது இந்த இரு உண்மைகளையும் மறைத்துவிடும்.

சில மறுப்புகள் ஒப்பீட்டுக்குக் கிடைத்த மாதிரித் தரவை மாற்றின. தொடர்புடைய இரு நிலைமைகளிலும் பெண் பாதிக்கப்பட்டவரைக் கொண்ட எட்டு prompt-களை Gemini 3.1 Pro மறுத்தது; பெண்ணைத் துன்புறுத்தும் 16 prompt-களை Claude Fable 5 மறுத்தது. அந்த மறுப்புகளை எண்ணியல் சராசரியிலிருந்து நீக்கி, தனியாகப் பதிவுசெய்தனர். Claude Fable 5-க்கான தரவின் ஒரு பகுதி, அணுகல் தடைபட்டதற்குப் பிறகு சேகரிக்கப்பட்டது; தடைக்கு முந்தைய மற்றும் பிந்தைய பதில்களை ஆசிரியர்கள் ஒப்பிட்டாலும், ஆவணப்படுத்தப்படாத மாதிரி மாற்றம் நிகழ்ந்திருக்க வாய்ப்பை அவர்களால் நிராகரிக்க முடியவில்லை.

## இந்தத் தணிக்கை வாசகருக்கு எதைச் சொல்ல முடியும்

இரண்டு தேர்ந்தெடுக்கப்பட்ட பணிகளில் குறைந்தபட்சம் ஒன்றிலாவது ஒரு சமமின்மை புள்ளியியல் முக்கியத்துவ வரம்பை எட்டியது என்பதையே பத்தில் எட்டு என்ற எண்ணிக்கை குறிக்கிறது. பத்து தயாரிப்புகளின் ஒட்டுமொத்த நியாயத்தன்மைக்கான தரவரிசை அது அல்ல. ஒவ்வொரு சோதனை முறையிலும் ஆசிரியர்கள் ஒரே மொழியையும் ஒரே சொற்றொடர் வடிவத்தையும் பயன்படுத்தினர்; ஒன்பது மாதிரிகளை நுகர்வோர் இடைமுகங்கள் வழியாகவும், ஒன்றை API வழியாகவும் சோதித்தனர். வேறு prompt-கள், பயன்பாட்டு அமைப்புகள், மாதிரி புதுப்பிப்புகள் மாறுபட்ட முடிவுகளைத் தரலாம். மாதிரிகள் ஏன் வேறுபட்டன என்பதைக் கண்டறிய உரிமையுரிய பயிற்சித் தரவு, நுணுக்கச் சரிசெய்தல், பாதுகாப்புத் தலையீடுகள் பற்றிய விவரம் கிடைக்கவில்லை என ஆசிரியர்கள் கூறுகின்றனர். பயிற்சித் தரவிலுள்ள மனிதத் தார்மிக உள்ளுணர்வுகள் சில பதில்களில் பிரதிபலிக்கலாம் என்ற அவர்களது பரிந்துரை ஒரு விளக்கம் மட்டுமே; இந்தச் சோதனைகள் நிறுவிய செயல்முறை அல்ல.

எளிய அடையாளங்களுக்கும் பதிவான பதில்களுக்கும் இடையிலான பொருந்தாமையே பயனுள்ள கண்டுபிடிப்பு. சொற்றொடர் அடையாளச் சோதனையில் GPT-5.5 குறிப்பிடத்தக்க இடைவெளியைக் காட்டவில்லை; ஆனால் தார்மிகச் சிக்கலில் பெரிய இடைவெளிகள் இருந்தன. DeepSeek-இல் இதற்கு மாறான கலவை காணப்பட்டது: சொற்றொடர் அடையாளத்தில் குறிப்பிடத்தக்க இடைவெளி, பாலினம் எதுவாக இருந்தாலும் ஒரே தார்மிக மதிப்பீடுகள். முக்கிய விளைவுகள் உள்ள பணிக்காக மாதிரியை மதிப்பிடுவோருக்கு, “சார்பு உள்ளது” அல்லது “சார்பு இல்லை” என்ற முடிவை வேறு சூழலுக்கு மாற்றிப் பயன்படுத்துவதற்கு முன், பணி, prompt, பதிப்பு, இடைமுகம் ஆகியவற்றைத் தெளிவாகக் குறிப்பிட வேண்டும் என்பதை இந்த முன்வெளியீடு நினைவூட்டுகிறது.

## ஆதாரங்களும் மேலும் வாசிப்பும்

- [Bolzoni மற்றும் Capraro, *பெரிய மொழி மாதிரிகளில் பாலினச் சார்பு பொதுவானதும் குறிப்பிடத்தக்க அளவு வேறுபடுவதும் ஆகும்*, arXiv v2 பதிப்பு](https://arxiv.org/html/2609.38036v2). மாதிரி பட்டியல், prompt வடிவமைப்புகள், மாதிரி எண்ணிக்கைகள், புள்ளியியல் ஒப்பீடுகள், மறுப்புகளின் எண்ணிக்கை, வரம்புகள் ஆகியவற்றுக்கான முதன்மை ஆதாரம் 2026 செப்டம்பர் 30-ஆம் தேதியிட்ட இந்த முன்வெளியீடு. அட்டவணைகள் 1–3 மற்றும் பிற்சேர்க்கைகள் A–C மாதிரி வாரியான முடிவுகளைத் தருகின்றன; காணப்பட்ட வேறுபாடுகளையும் சாத்தியமான விளக்கங்களையும் அதன் கலந்துரையாடல் தனித்துப் பிரிக்கிறது. arXiv பதிவின்படி முதல் சமர்ப்பிப்பு செப்டம்பர் 29-ஆம் தேதியும் திருத்தப்பட்ட பதிப்பு செப்டம்பர் 30-ஆம் தேதியும் பதிவானது.
- [ஆசிரியர்களின் Figshare தரவு மற்றும் பகுப்பாய்வுக் களஞ்சியம்](https://doi.org/10.6084/m9.figshare.34018470). பதில் தரவு, துல்லியமான prompt-கள், துணை முடிவுகள், Stata பகுப்பாய்வுக் கோப்புகள் ஆகியவை இந்தத் தொகுப்பில் இருப்பதாகக் கட்டுரையின் தரவுக் குறிப்பு கூறுகிறது. இந்த இணைப்பு ஆய்வைச் சுயாதீனமாக ஆராய உதவுகிறது; BIG CHANGE பகுப்பாய்வை மீண்டும் நடத்தவோ மாதிரிகளுக்கு prompt அளிக்கவோ இல்லை.
- [Fulgu மற்றும் Capraro, *GPT-இல் வியப்பூட்டும் பாலினச் சார்புகள்*](https://arxiv.org/abs/2407.06003). புதிய பல நிறுவன மாதிரி ஒப்பீட்டில் மீண்டும் பயன்படுத்தப்பட்ட சொற்றொடர் இணைகளையும் தார்மிகச் சிக்கல் அமைப்பையும் இந்த முந்தைய ஆய்வு வழங்கியது. GPT மட்டும் சார்ந்த அதன் முடிவுகளை 2026 மாதிரி முடிவுகளுக்கான மாற்றாகப் பயன்படுத்தக்கூடாது.

## Sources

- [Bolzoni மற்றும் Capraro, பெரிய மொழி மாதிரிகளில் பாலினச் சார்பு பொதுவானதும் குறிப்பிடத்தக்க அளவு வேறுபடுவதும் ஆகும் (arXiv v2)](https://arxiv.org/html/2609.38036v2) — முழு உரையுடன் கூடிய முதன்மை முன்வெளியீடு. முறைகள் 2.1 மற்றும் 3.1 பிரிவுகள், அட்டவணைகள் 1–3 மற்றும் பிற்சேர்க்கைகள் A–C-இல் உள்ள மாதிரி வாரியான முடிவுகள், பிரிவு 4-இல் உள்ள வரம்புகள் ஆகியவை கட்டுரைக்கான ஆதாரமாக உள்ளன. arXiv பதிப்பு வரலாற்றில் முதல் சமர்ப்பிப்பு செப்டம்பர் 29 என்றும் v2 திருத்தம் செப்டம்பர் 30 என்றும் பதிவாகியுள்ளது. மதிப்பாய்வு செய்யப்பட்ட இதழில் வெளியானதாகச் சரிபார்க்கப்பட்ட கூற்று இல்லை.
- [ஆசிரியர்களின் Figshare தரவு மற்றும் பகுப்பாய்வுக் களஞ்சியம்](https://doi.org/10.6084/m9.figshare.34018470) — பதில் தரவு, துல்லியமான prompt-கள், துணை முடிவுகள், Stata குறியீடு ஆகியவை இந்தத் தொகுப்பில் இருப்பதாக முன்வெளியீட்டின் தரவுக் குறிப்பு அடையாளப்படுத்துகிறது. கிடைத்த இணையக் கருவி வழியாகக் களஞ்சியத்தின் முதன்மைப் பக்கத்தைத் திறக்க முடியவில்லை; BIG CHANGE அந்தக் கோப்புகளை ஆய்வு செய்யவோ மீண்டும் இயக்கவோ இல்லை.
- [Fulgu மற்றும் Capraro, GPT-இல் வியப்பூட்டும் பாலினச் சார்புகள்](https://arxiv.org/abs/2407.06003) — புதிய ஒப்பீட்டில் மீண்டும் பயன்படுத்தப்பட்ட சொற்றொடர் இணைகளையும் தார்மிகச் சிக்கல் அமைப்பையும் வழங்கிய முந்தைய ஆய்வு. அதன் GPT-மட்டுமே சார்ந்த முடிவுகள் பின்னணித் தகவல்; 2026 மாதிரி முடிவுகளுக்கான ஆதாரம் அல்ல.
BIG CHANGE செய்திமடல்

பெரிய பார்வை. உங்கள் வேகத்தில்.

AI மற்றும் ரோபாட்டிக்ஸ் பற்றிய சமீபத்திய செய்திகள், கவனிக்க வேண்டிய மாற்றங்கள், பயன்படுத்தக்கூடிய நடைமுறைக் கருத்துகள். தினசரி விளக்கக் குறிப்பு, வாராந்திரத் தொகுப்பு அல்லது மாதாந்திரப் பார்வையைத் தேர்ந்தெடுக்கவும்.