हे openTPU रिपॉझिटरी Python instruction-set सिम्युलेटर, compiler, SystemVerilog डिझाइन आणि FPGA host tools यांना एका प्रकल्पात एकत्र आणते. लेखकांच्या मते, त्यांनी Inspur Kintex-7 कार्डवर भाषा-मॉडेल चालवली. ML systems किंवा FPGA विकसकांसाठी सुरुवातीचा सहज मार्ग म्हणजे प्रत्यक्ष मॉडेल weights वापरून software chat चालवणे. हाच प्रकल्प कार्डवर नेण्यासाठी विशिष्ट बोर्ड, परवानाधारक build tools आणि Linux host सेटअप आवश्यक आहे. ही मार्गदर्शिका 7 ऑक्टोबर 2026 च्या commit b9a3f3b मधील रिपॉझिटरीचा मागोवा घेते; BIG CHANGE ने ते install, simulate किंवा test केलेले नाही.
मोठा बदल
- काय बदलले: openTPU accelerator चा instruction set, simulator, compiler, RTL आणि बोर्ड एकत्रीकरण एकाच वेळी प्रकाशित करते. समर्थित कार्ड घेण्यापूर्वी अभियंता मॉडेल ऑपरेशनपासून simulated instructions पर्यंतचा प्रवास तपासू शकतो.
- हे महत्त्वाचे का:दस्तऐवजीकृत सिम्युलेटरमुळे हार्डवेअर शिकणाऱ्यांना डिझाइन समजून घेण्याचा आणि सामान्य host software वापरून लहान भाषा-मॉडेल चालवण्याचा ठोस मार्ग मिळतो. AI agents ने hardware stack तयार करण्यास मदत केली, असे प्रकल्प सांगतो; तपासता येण्याजोगे artifacts या विकास-दाव्याचे परीक्षण शक्य करतात, तर कार्डवरील नोंदवलेले निकाल प्रकल्पाची स्वतःची मोजमापे राहतात.
- कशाकडे लक्ष द्यावे:प्रत्यक्ष निकाल पुन्हा मिळवण्यासाठी Kintex-7 बोर्ड, परवानाधारक Vivado build आणि कार्यरत PCIe bring-up आवश्यक आहे. त्यासाठी रिपॉझिटरी commands आणि self-tests देते. ठरवलेल्या revision वर स्वतंत्र रन केल्यास इतर अभियंते निकाल किती सहज पुन्हा मिळवतात हे कळेल.
स्रोत निश्चित करा आणि सॉफ्टवेअर मार्ग निवडा
खालील पायऱ्या main रिपॉझिटरीमधील commit b9a3f3bc98e7f74808fd5650bf9db33eaf7b2c93 चे अनुसरण करतात; ते 7 ऑक्टोबर रोजी commit केले गेले. रिपॉझिटरीमध्ये v0.5 tag आहे; मात्र या मार्गदर्शिकेत नंतरचे निश्चित commit वापरले आहे, कारण त्याच्या README मध्ये नवीन Hugging Face प्रमाणीकरण विभाग आहे. Python package अजूनही 0.1.0 मध्ये स्वतःची आवृत्ती pyproject.toml अशी दाखवते; केवळ package क्रमांकामुळे source snapshot ओळखता येत नाही. रिपॉझिटरी Apache 2.0 परवान्याखाली आहे.
तुम्हाला Python 3.10 किंवा त्यानंतरची आवृत्ती लागेल. Package numpy आणि textual घोषित करते; चाचण्या आणि मॉडेल वापरासाठी README स्वतंत्रपणे pytest, torch आणि transformers install करते. Hugging Face चा hf command checkpoint models/LFM2.5-230M मध्ये डाउनलोड करण्याचे README दाखवते. डाउनलोड करण्यापूर्वी तुमच्या Python environment मध्ये hf उपलब्ध आहे का तपासा. Checkpoint हा chat command साठी input आहे; source सोबत दिलेले मॉडेल नाही. या मार्गासाठी एकूण download आकार, host memory आवश्यकता किंवा सिम्युलेटरची निश्चित runtime प्रकल्प सांगत नाही.
रिपॉझिटरीच्या root मधून दस्तऐवजीकृत क्रम असा आहे:
git clone https://github.com/FeSens/openTPU.git
cd openTPU
git checkout b9a3f3bc98e7f74808fd5650bf9db33eaf7b2c93
pip install -e .
pip install pytest torch transformers
python3 -m pytest -q
hf download LiquidAI/LFM2.5-230M --local-dir models/LFM2.5-230M
otpu-chat --model lfm2 --backend isaCheckout commands तपासलेली revision निश्चित करतात; install, test, download आणि chat commands README मधील आहेत. --backend isa Python instruction-set simulator निवडते. पूर्ण pytest suite मध्ये Verilator 5 लागणाऱ्या RTL चाचण्याही आहेत; त्यामुळे हे साधन नसलेल्या मशीनवर पूर्ण suite ला केवळ सॉफ्टवेअरद्वारे यश तपासण्याचा निकष मानता येत नाही. सर्वांत लहान दस्तऐवजीकृत interactive run पूर्ण झाल्याचे चिन्ह म्हणजे LFM2.5-230M checkpoint लोड होणे आणि त्यानंतर prompt स्वीकारून मॉडेल मजकूर परत देणारा chat interface दिसणे. तयार उत्तरातील अचूक शब्द prompt आणि sampling वर अवलंबून असतात. chat CLI source terminal REPL साठी --plain आणि एकदाच उत्तर मिळवण्यासाठी --prompt देखील देते; दुसरा पर्याय उत्तर आणि turn statistics छापतो. हे दस्तऐवजीकृत interfaces आहेत, BIG CHANGE ने पाहिलेले आउटपुट नाही.
README मध्ये Qwen3-0.6B, LFM2.5-230M आणि Qwen3.5-0.8B हे मुख्य chat पर्याय तसेच आणखी मोठी काही मॉडेल्स दिली आहेत. प्रत्येकासाठी अपेक्षित model directory मध्ये स्वतंत्र checkpoint किंवा स्पष्ट checkpoint path आवश्यक आहे. वरील LFM2 मार्ग हा रिपॉझिटरीतील सर्वांत लहान model-download उदाहरण आहे. README मधील व्यापक निकालांत कार्डवर दहा मॉडेल्स आहेत; त्यात Gemma 4 आणि expert offloading लागणारी मॉडेल्सही आहेत, तर काहींसाठी अनेक weight formats तपासले आहेत. ही लेखकांची मोजमापे आहेत; प्रत्येक मॉडेल या एक-command LFM2 सेटअपमध्ये चालेल याची हमी नाही.
सिम्युलेटर काय तपासतो
प्रकल्पाच्या वर्णनानुसार kernel language आणि compiler accelerator साठी instructions तयार करतात. Python ISA simulator त्या instructions चालवतो; SystemVerilog RTL ही हार्डवेअरची अंमलबजावणी आहे. README मधील system outline आणि opentpu/isasim.py या सीमारेषेचा मागोवा घेण्यास मदत करतात. otpu-chat सोबत isa चालवल्यास software instruction path मधून model inference होते. त्यामुळे FPGA program होत नाही किंवा कार्डचा throughput मोजला जात नाही.
त्यांच्या कार्डवर सिम्युलेटरसारखेच bit-for-bit tokens मिळतात, असे maintainers सांगतात. निवडक device runs ची CPU Hugging Face reference शी तुलना करणारी प्रमाणीकरण स्क्रिप्ट ते देतात. निश्चित README मध्ये default prompts, token आणि logit तुलना तसेच 7 ऑक्टोबरचा card run वर्णन केला आहे. अहवाल आणि कोडमुळे या तपासण्या पाहता येतात. BIG CHANGE ने त्या पुन्हा केल्या नाहीत; त्यामुळे स्वतंत्र अचूकता किंवा वेग सिद्ध होत नाही.
प्रत्यक्ष कार्ड वापरल्यावर काय बदलते
हे बोर्ड मॅन्युअल लक्ष्य करते Inspur YPCB-00338 आणि Xilinx Kintex-7 xc7k480t-ffg1156-2 यांना लक्ष्य करते; त्यात दोन 2 GiB DDR3 channels आणि host PC शी PCIe connection आहे. त्याचा default bitstream build Vivado 2026.1 वापरतो. मोफत आवृत्तीत हे device नसल्याचे मॅन्युअल सांगते आणि सशुल्क परवाना किंवा 30-दिवसांची evaluation सुचवते. AMD ची 2026.1 device table या device दाव्याशी विसंगत आहे: Basic मध्ये सर्व Kintex 7 devices समाविष्ट आहेत।
AMD चे सध्याचे परवाना पर्याय Basic ची किंमत $0, Linux support आणि मोफत वार्षिक renewal दाखवतात. परवाना FAQ नुसार Basic साठीही वैध वार्षिक license file आवश्यक आहे; स्वतंत्र full-feature evaluation 60 दिवस चालते. AMD ची 2026.1 feature table Basic मध्ये JTAG programming दाखवते, पण XSIM simulation आणि काही debug features मर्यादित करते. उच्च सशुल्क स्तर अधिक features देतात आणि IP licensing बदललेले नाही, असे AMD सांगते. BIG CHANGE ने Basic वर openTPU build केलेले नाही. हा zero-cost build आहे असे म्हणण्यापूर्वी या bitstream flow साठी tool आणि IP वापराचे अधिकार तपासावेत. बोर्ड मॅन्युअलनुसार make bit ला मशीननुसार 1.5 ते 3 तास लागतात. हे मॅन्युअल किंवा AMD tier table कार्डची खरेदी किंमत अथवा पुनरुत्पादनाचा एकूण खर्च सांगत नाही.
बोर्ड आणि toolchain मिळाल्यावर दस्तऐवजीकृत बोर्ड मार्गात boards/ypcb-00338 मध्ये bitstream build करणे, JTAG द्वारे FPGA program करणे आणि Linux host configure करणे येते. बोर्डचा Makefile पाठवतो make bit output build/vivado/otpu.bit कडे पाठवतो. make program default ने openFPGALoader वापरते; मॅन्युअल Vivado hardware manager चेही वर्णन करते. JTAG load वीज बंद करून पुन्हा सुरू केल्यावर टिकत नाही.
cd boards/ypcb-00338
make lint
make bit
make programवरील हार्डवेअर पायऱ्या बोर्ड मॅन्युअलमधील आहेत; येथे तपासलेला क्रम नाही. Linux host वरील bring-up checklist मध्ये Python package आणि checkpoint, XDMA driver आणि device rules install करण्यासाठी sudo otpu-setup, JTAG load नंतर PCIe rescan आणि otpu-setup --check यांचा समावेश आहे. driver, card, link, device nodes आणि ID register योग्य असल्यास शेवटचा command यशस्वीपणे exit होऊन “all in place” दाखवतो, असे दस्तऐवजीकरण आहे. त्यानंतर otpu-selftest कार्ड तपासते आणि मग otpu-chat --backend board --model lfm2 चालते. बोर्ड diagnostics otpu-diag --json diag.json ने जतन करता येतात. ही card path ची ठोस completion signals आहेत; केवळ ISA chat त्यांची जागा घेऊ शकत नाही.
प्रकाशित performance आकडेही तितक्याच काळजीने पाहायला हवेत. लेखकांच्या कार्डवर 4-bit weights आणि int8 head असलेल्या LFM2.5-230M साठी README उदाहरणार्थ प्रति सेकंद 82.1 tokens wall time नोंदवते. पद्धतीत 512-token prompt नंतर 64 greedy decode tokens वापरले आहेत; table device cycles आणि host-सह wall time वेगळे दाखवते. दुसरा host, bitstream, weight format किंवा prompt म्हणजे वेगळे मोजमाप. 7 ऑक्टोबरचा commit message कार्डवरील अतिरिक्त qualification नोंदवतो, पण ती maintainer ची नोंदच आहे. या मार्गदर्शिकेसाठी तपासलेल्या स्रोतांत स्वतंत्रपणे पुनरुत्पादित benchmark नाही.
स्रोत आणि पुढील वाचन
- तपासलेल्या commit मधील openTPU repository, 7 ऑक्टोबर 2026. README मध्ये system outline, simulator commands, model list आणि लेखकांनी स्वतः नोंदवलेली board measurements आहेत. हे प्रकल्पाचे दावे आहेत; BIG CHANGE ने रिपॉझिटरी चालवली नाही.
- Python package metadata आणि Apache 2.0 परवाना Python version, घोषित dependencies, CLI entry points, package version आणि source license निश्चित करतात. Model checkpoints आणि Vivado साठी स्वतंत्र अटी व आवश्यकता आहेत.
- बोर्ड व host bring-up मॅन्युअल, 7 ऑक्टोबर 2026 रोजी तपासले. समर्थित कार्ड, bitstream पायऱ्या, Linux सेटअप, JTAG programming आणि self-tests दिल्या आहेत. सशुल्क परवाना व 30-दिवसांच्या evaluation विषयीचे दावे AMD च्या सध्याच्या 2026.1 परवाना कागदपत्रांशी विसंगत आहेत. काही ऐतिहासिक bitstream उदाहरणे जुन्या builds ची आहेत; पुनरुत्पादनासाठी निश्चित tree आणि सध्याच्या build सूचना वापरा.
- AMD Vivado 2026.1 device availability, UG973 आणि समर्थित devices आणि features, दोन्ही 23 जून 2026 चे, तसेच परवाना पर्याय, 7 ऑक्टोबर रोजी तपासले. यांत सर्व Kintex 7 devices मोफत Basic मध्ये दाखवले आहेत, Linux आणि JTAG support दिले आहे आणि Basic च्या simulation/debug मर्यादा स्पष्ट केल्या आहेत. AMD परवाना FAQ वार्षिक Basic license file आणि 60-दिवसांची evaluation सांगते. device coverage मुळे या प्रकल्पाचा संपूर्ण bitstream flow Basic वर चालतो हे सिद्ध होत नाही.
- Chat CLI आणि LFM2 मार्गदर्शिका backend निवड, model path, interactive व one-shot output वर्तन आणि लहान checkpoint उदाहरण दाखवतात.
- 7 ऑक्टोबरचा GIGAZINE अहवाल प्रकल्पाला मिळालेल्या सार्वजनिक लक्षाचा उपयोगी संदर्भ देतो. या मार्गदर्शिकेतील सेटअप आणि performance तपशील अहवालातून नव्हे तर रिपॉझिटरीतून तपासले.



