यह openTPU रिपॉज़िटरी Python instruction-set सिम्युलेटर, compiler, SystemVerilog design और FPGA host tools को एक ही प्रोजेक्ट में रखती है। इसके लेखकों का कहना है कि उन्होंने Inspur Kintex-7 कार्ड पर भाषा-मॉडल चलाए। ML systems या FPGA डेवलपर के लिए शुरुआत का सबसे सुलभ तरीका वास्तविक मॉडल weights के साथ software chat चलाना है। उसी प्रोजेक्ट को कार्ड पर ले जाने के लिए एक खास बोर्ड, लाइसेंस वाले build tools और Linux host सेटअप की ज़रूरत पड़ती है। यह गाइड 7 अक्टूबर 2026 के commit b9a3f3b के रिपॉज़िटरी संस्करण का अनुसरण करती है; BIG CHANGE ने इसे इंस्टॉल, सिम्युलेट या टेस्ट नहीं किया है।

बड़ा बदलाव

  • क्या बदला: openTPU accelerator का instruction set, simulator, compiler, RTL और board integration एक साथ प्रकाशित करता है। समर्थित कार्ड खरीदने से पहले इंजीनियर मॉडल operation से simulated instructions तक का रास्ता देख सकता है।
  • यह क्यों मायने रखता है:दस्तावेज़ित सिम्युलेटर हार्डवेयर सीखने वालों को डिज़ाइन समझने और सामान्य host software से छोटा भाषा-मॉडल चलाने का ठोस तरीका देता है। प्रोजेक्ट का कहना है कि AI agents ने hardware stack बनाने में मदद की; जाँचे जा सकने वाले artifacts इस development claim को परखने का आधार देते हैं, जबकि कार्ड पर बताए गए नतीजे अभी भी प्रोजेक्ट के अपने माप हैं।
  • क्या देखना है:भौतिक नतीजे को दोहराने के लिए Kintex-7 बोर्ड, लाइसेंस वाला Vivado build और काम करता PCIe bring-up चाहिए। रिपॉज़िटरी इस काम के लिए commands और self-tests देती है। किसी pinned revision पर स्वतंत्र run से पता चलेगा कि दूसरे इंजीनियर इसे कितनी आसानी से दोहरा सकते हैं।

स्रोत को pin करें और software path चुनें

नीचे के चरण main रिपॉज़िटरी के commit b9a3f3bc98e7f74808fd5650bf9db33eaf7b2c93 का अनुसरण करते हैं, जो 7 अक्टूबर को commit किया गया था। रिपॉज़िटरी में एक v0.5 tag है, लेकिन यह गाइड बाद वाला pinned commit इस्तेमाल करती है, क्योंकि उसके README में नया Hugging Face validation section है। Python package अब भी 0.1.0 में अपना version pyproject.toml बताता है; केवल package number से source snapshot की पहचान नहीं होती। रिपॉज़िटरी Apache 2.0 लाइसेंस के तहत है।

आपको Python 3.10 या नया संस्करण चाहिए। पैकेज numpy और textual घोषित करता है; README परीक्षण और मॉडल उपयोग के लिए अलग से pytest, torch और transformers इंस्टॉल करता है। इसमें Hugging Face का hf command checkpoint को models/LFM2.5-230M में डाउनलोड करता है। डाउनलोड से पहले जाँचें कि आपके Python environment में hf उपलब्ध है। Checkpoint chat command का input है, स्रोत के साथ शामिल मॉडल नहीं। इस path के लिए प्रोजेक्ट कुल download size, host memory की ज़रूरत या simulator का तय runtime नहीं बताता।

रिपॉज़िटरी root से दस्तावेज़ित क्रम यह है:

Terminal
git clone https://github.com/FeSens/openTPU.git
cd openTPU
git checkout b9a3f3bc98e7f74808fd5650bf9db33eaf7b2c93
pip install -e .
pip install pytest torch transformers
python3 -m pytest -q
hf download LiquidAI/LFM2.5-230M --local-dir models/LFM2.5-230M
otpu-chat --model lfm2 --backend isa

Checkout commands जाँची गई revision को pin करते हैं; install, test, download और chat commands README से हैं। --backend isa Python instruction-set simulator चुनता है। पूरी pytest suite में RTL tests भी हैं जिनके लिए Verilator 5 चाहिए, इसलिए उस टूल के बिना कोई मशीन पूरी suite को केवल software से सफलता की जाँच के रूप में इस्तेमाल नहीं कर सकती। सबसे छोटे दस्तावेज़ित interactive run के पूरा होने का संकेत है LFM2.5-230M checkpoint लोड होना, फिर ऐसा chat interface जो prompt स्वीकार करे और मॉडल text लौटाए। बने हुए जवाब के सटीक शब्द prompt और sampling पर निर्भर करते हैं। chat CLI source terminal REPL के लिए --plain और एक बार का जवाब पाने के लिए --prompt भी देता है; दूसरा जवाब और turn statistics छापता है। ये दस्तावेज़ित interfaces हैं, BIG CHANGE द्वारा देखा गया output नहीं।

README मुख्य chat विकल्पों में Qwen3-0.6B, LFM2.5-230M और Qwen3.5-0.8B के साथ कई बड़े मॉडल भी सूचीबद्ध करता है। हर मॉडल को अपेक्षित model directory में अपना checkpoint या स्पष्ट checkpoint path चाहिए। ऊपर का LFM2 path रिपॉज़िटरी का सबसे छोटा model-download उदाहरण है। README के व्यापक नतीजे कार्ड पर दस मॉडलों को शामिल करते हैं, जिनमें Gemma 4 और expert offloading की ज़रूरत वाले मॉडल भी हैं; कुछ के कई weight formats भी हैं। यह तालिका लेखकों के मापों का सेट है, यह वादा नहीं कि हर मॉडल इसी एक-command LFM2 सेटअप से चलेगा।

सिम्युलेटर क्या जाँचता है

प्रोजेक्ट के अनुसार kernel language और compiler उसके accelerator के लिए instructions बनाते हैं। Python ISA simulator उन instructions को चलाता है; SystemVerilog RTL हार्डवेयर implementation है। README की system outline और opentpu/isasim.py इस सीमा को समझने में मदद करते हैं। otpu-chat को isa के साथ चलाने पर software instruction path से model inference होता है। इससे FPGA प्रोग्राम नहीं होता और कार्ड का throughput नहीं मापा जाता।

रखरखावकर्ताओं का कहना है कि उनका कार्ड simulator के tokens bit-for-bit बनाता है। वे चुने गए device runs की CPU Hugging Face reference से तुलना के लिए validation script भी देते हैं। Pinned README default prompts, token और logit तुलना तथा 7 अक्टूबर के card run का वर्णन करता है। रिपोर्ट और code से इन जाँचों को देखा जा सकता है। BIG CHANGE ने इन्हें दोहराया नहीं है, इसलिए ये स्वतंत्र accuracy या speed साबित नहीं करते।

भौतिक कार्ड पर क्या बदलता है

यह board manual लक्षित करता है Inspur YPCB-00338 और Xilinx Kintex-7 xc7k480t-ffg1156-2 को लक्षित करता है; इसमें दो 2 GiB DDR3 channels और host PC से PCIe connection है। इसका default bitstream build Vivado 2026.1 इस्तेमाल करता है। Manual कहता है कि free edition में यह device नहीं है और paid license या 30-day evaluation सुझाता है। AMD की 2026.1 device table device के इस दावे का खंडन करती है: Basic में सभी Kintex 7 devices शामिल हैं।

AMD के मौजूदा licensing विकल्प Basic की कीमत $0 बताते हैं, Linux support और मुफ्त annual renewal के साथ। Licensing FAQ के अनुसार Basic को भी वैध annual license file चाहिए; अलग full-feature evaluation 60 दिन तक चलती है। AMD की 2026.1 feature table Basic में JTAG programming दिखाती है, लेकिन XSIM simulation और कुछ debug features सीमित हैं। ऊँचे paid tiers में और features मिलते हैं, और AMD कहता है कि IP licensing नहीं बदली। BIG CHANGE ने Basic पर openTPU build नहीं किया। इसे बिना लागत का build मानने से पहले इस bitstream path के tool और IP entitlements जाँचने होंगे। Board manual make bit के लिए मशीन के अनुसार 1.5 से 3 घंटे का अनुमान देता है। न manual, न AMD tier table इस कार्ड की खरीद कीमत या कुल reproduction cost बताते हैं।

बोर्ड और toolchain मिलने के बाद दस्तावेज़ित board path में boards/ypcb-00338 में bitstream build करना, JTAG से FPGA program करना और Linux host configure करना शामिल है। बोर्ड का Makefile भेजता है make bit output को build/vivado/otpu.bit भेजता है। make program default रूप से openFPGALoader इस्तेमाल करता है; manual Vivado hardware manager का भी वर्णन करता है। JTAG load बिजली बंद करके फिर चालू करने के बाद बना नहीं रहता।

Terminal
cd boards/ypcb-00338
make lint
make bit
make program

ऊपर के hardware steps board manual से हैं, यहाँ जाँचा हुआ क्रम नहीं। Linux host पर bring-up checklist Python package और checkpoint, sudo otpu-setup से XDMA driver और device rules इंस्टॉल करना, JTAG load के बाद PCIe rescan और otpu-setup --check माँगती है। दस्तावेज़ के अनुसार driver, card, link, device nodes और ID register सही होने पर आखिरी command सफलतापूर्वक exit करके “all in place” दिखाता है। फिर otpu-selftest कार्ड जाँचता है, उसके बाद otpu-chat --backend board --model lfm2 चलता है। Board diagnostics को otpu-diag --json diag.json से सहेजा जा सकता है। ये card path के ठोस completion signals हैं; केवल ISA chat इनकी जगह नहीं ले सकता।

प्रकाशित performance आंकड़ों को भी इसी सावधानी से देखना चाहिए। README उदाहरण के तौर पर लेखकों के कार्ड पर 4-bit weights और int8 head वाले LFM2.5-230M के लिए 82.1 tokens प्रति सेकंड wall time रिपोर्ट करता है। विधि 512-token prompt के बाद 64 greedy decode tokens इस्तेमाल करती है, और तालिका device cycles को host सहित wall time से अलग रखती है। दूसरा host, bitstream, weight format या prompt एक अलग माप है। 7 अक्टूबर का commit message कार्ड पर अतिरिक्त qualification की रिपोर्ट देता है, पर वह अब भी maintainer record है। इस गाइड के लिए देखे गए स्रोतों में प्रोजेक्ट का कोई independently reproduced benchmark नहीं है।

स्रोत और आगे पढ़ें

  • जाँचे गए commit पर openTPU repository, 7 अक्टूबर 2026। README system outline, simulator commands, model list और स्वयं बताए गए board measurements देता है। ये प्रोजेक्ट के दावे हैं; BIG CHANGE ने repository नहीं चलाई।
  • Python package metadata और Apache 2.0 license। ये Python version, घोषित dependencies, CLI entry points, package version और source license स्थापित करते हैं। Model checkpoints और Vivado की शर्तें व ज़रूरतें अलग हैं।
  • Board और host bring-up manual, 7 अक्टूबर 2026 को जाँचा गया। यह supported card, bitstream steps, Linux setup, JTAG programming और self-tests बताता है। Paid-license और 30-day evaluation के इसके बयान AMD के मौजूदा 2026.1 licensing documents से मेल नहीं खाते। कुछ ऐतिहासिक bitstream उदाहरण पुराने builds से हैं; दोहराते समय pinned tree और मौजूदा build instructions इस्तेमाल करें।
  • AMD Vivado 2026.1 device availability, UG973 और supported devices and features, दोनों 23 जून 2026 के हैं; साथ में licensing options भी हैं, 7 अक्टूबर को जाँचे गए। ये सभी Kintex 7 devices को मुफ्त Basic में रखते हैं, Linux और JTAG support बताते हैं और Basic की simulation/debug सीमाएँ दिखाते हैं। AMD licensing FAQ annual Basic license file और 60-day evaluation बताता है। केवल device coverage इस प्रोजेक्ट के पूरे bitstream path को Basic में सत्यापित नहीं करती।
  • Chat CLI और LFM2 guide backend selection, model path, interactive और one-shot output व्यवहार तथा छोटे checkpoint उदाहरण दिखाते हैं।
  • GIGAZINE की 7 अक्टूबर की रिपोर्ट प्रोजेक्ट पर सार्वजनिक ध्यान का उपयोगी संदर्भ देती है। इस गाइड के setup और performance विवरण रिपोर्ट से नहीं, रिपॉज़िटरी से जाँचे गए।