के तपाईं एउटा सानो आवाज सहायक चाहनुहुन्छ जसले वास्तवमा तपाईंको नेतृत्व पछ्याउँछ, तपाईंको आफ्नै हार्डवेयरमा चल्छ, र तपाईंलाई गलत सुनेको कारणले गर्दा गल्तिले बाह्र अनानास अर्डर गर्दैन? Raspberry Pi भएको DIY AI सहायक आश्चर्यजनक रूपमा प्राप्त गर्न सकिने, रमाइलो र लचिलो छ। तपाईंले एउटा वेक वर्ड, स्पीच रिकग्निसन (ASR = स्वचालित स्पीच रिकग्निसन), प्राकृतिक भाषाको लागि दिमाग (नियम वा LLM), र टेक्स्ट-टु-स्पीच (TTS) लाई तार गर्नुहुनेछ। केही स्क्रिप्टहरू, एक वा दुई सेवाहरू, र केही सावधानीपूर्वक अडियो ट्वीकहरू थप्नुहोस्, र तपाईंसँग पकेटेबल स्मार्ट स्पिकर छ जसले तपाईंको नियमहरू पालना गर्दछ।
सामान्य झन्झट बिना नै तपाईंलाई शून्यबाट तपाईंको पाईसँग कुरा गर्ने तरिकामा पुर्याउँछौं। हामी भागहरू, सेटअप, कोड, तुलनाहरू, गोचाहरू ... सम्पूर्ण बुरिटो समेट्नेछौं। 🌯
यसपछि पढ्न मन लाग्ने लेखहरू:
🔗 कसरी प्रभावकारी रूपमा एआई अध्ययन गर्ने
अध्ययन रोडम्याप बनाउनुहोस्, परियोजनाहरू अभ्यास गर्नुहोस्, र प्रगति ट्र्याक गर्नुहोस्।.
🔗 एआई कम्पनी कसरी सुरु गर्ने
समस्या प्रमाणित गर्नुहोस्, MVP निर्माण गर्नुहोस्, टोली भेला गर्नुहोस्, प्रारम्भिक ग्राहकहरू सुरक्षित गर्नुहोस्।.
🔗 अझ उत्पादक बन्न एआई कसरी प्रयोग गर्ने
नियमित कार्यहरू स्वचालित गर्नुहोस्, कार्यप्रवाहलाई सुव्यवस्थित गर्नुहोस्, र रचनात्मक आउटपुट बढाउनुहोस्।.
🔗 तपाईंको व्यवसायमा एआई कसरी समावेश गर्ने
उच्च-प्रभावकारी प्रक्रियाहरू पहिचान गर्नुहोस्, पाइलटहरू लागू गर्नुहोस्, ROI मापन गर्नुहोस्, स्केल गर्नुहोस्।.
रास्पबेरी पाईको साथ राम्रो DIY AI सहायक के बनाउँछ ✅
-
पूर्वनिर्धारित रूपमा निजी - सम्भव भएसम्म अडियो स्थानीय राख्नुहोस्। उपकरणमा के बाँकी रहन्छ भन्ने कुरा तपाईं निर्णय गर्नुहुन्छ।
-
मोड्युलर - लेगो जस्ता कम्पोनेन्टहरू स्वाप गर्नुहोस्: वेक वर्ड इन्जिन, ASR, LLM, TTS।
-
किफायती - प्रायः खुला स्रोत, कमोडिटी माइक, स्पिकर, र एक पाई।
-
ह्याक गर्न मिल्ने - गृह स्वचालन, ड्यासबोर्ड, दिनचर्या, अनुकूलन सीपहरू चाहनुहुन्छ? सजिलो।
-
भरपर्दो - सेवा-व्यवस्थित, बुट हुन्छ र स्वचालित रूपमा सुन्न सुरु हुन्छ।
-
रमाइलो - तपाईंले अडियो, प्रक्रियाहरू, र घटना-संचालित डिजाइनको बारेमा धेरै कुरा सिक्नुहुनेछ।
सानो सुझाव: यदि तपाईं रास्पबेरी पाई ५ प्रयोग गर्नुहुन्छ र भारी स्थानीय मोडेलहरू चलाउने योजना बनाउनुहुन्छ भने, क्लिप-अन कूलरले निरन्तर भारमा मद्दत गर्दछ। (शंकामा, पाई ५ को लागि डिजाइन गरिएको आधिकारिक सक्रिय कूलर छान्नुहोस्।) [1]
तपाईंलाई चाहिने पार्टपुर्जा र उपकरणहरू 🧰
-
रास्पबेरी पाई: हेडरूमको लागि पाई ४ वा पाई ५ सिफारिस गरिन्छ।
-
माइक्रोएसडी कार्ड: ३२ जीबी+ सिफारिस गरिएको।
-
USB माइक्रोफोन: एउटा साधारण USB सम्मेलन माइक राम्रो हुन्छ।
-
स्पिकर: USB वा ३.५ मिमी स्पिकर, वा I2S एम्प HAT।
-
नेटवर्क: इथरनेट वा वाइफाइ।
-
वैकल्पिक सुविधाहरू: केस, सक्रिय कूलर , पुश-टु-टकको लागि पुश बटन, LED रिंग। [1]
OS र आधारभूत सेटअप
-
रास्पबेरी पाई ओएस फ्ल्यास गर्नुहोस् । यो तपाईंले चाहनुभएको प्रिसेटहरू सहित बुटेबल माइक्रोएसडी प्राप्त गर्ने सीधा तरिका हो। [1]
-
बुट गर्नुहोस्, नेटवर्कमा जडान गर्नुहोस्, त्यसपछि प्याकेजहरू अद्यावधिक गर्नुहोस्:
sudo apt अपडेट र sudo apt अपग्रेड -y
-
अडियो आधारभूत कुराहरू : Raspberry Pi OS मा तपाईंले डेस्कटप UI वा
raspi-configमार्फत पूर्वनिर्धारित आउटपुट, स्तरहरू र उपकरणहरू सेट गर्न सक्नुहुन्छ । USB र HDMI अडियो सबै मोडेलहरूमा समर्थित छन्; ब्लुटुथ भएका मोडेलहरूमा ब्लुटुथ आउटपुट उपलब्ध छ। [1] -
उपकरणहरू प्रमाणित गर्नुहोस्:
रेकर्ड -l प्ले -l
त्यसपछि क्याप्चर र प्लेब्याक परीक्षण गर्नुहोस्। यदि स्तरहरू अनौठा लाग्छन् भने, माइकलाई दोष दिनु अघि मिक्सरहरू र पूर्वनिर्धारितहरू जाँच गर्नुहोस्।.

वास्तुकला एक नजरमा 🗺️
एक समझदार DIY AI सहायक यस्तो देखिन्छ:
वेक वर्ड → लाइभ अडियो क्याप्चर → ASR ट्रान्सक्रिप्शन → इन्टेन्ट ह्यान्डलिङ वा LLM → प्रतिक्रिया पाठ → TTS → अडियो प्लेब्याक → MQTT वा HTTP मार्फत वैकल्पिक कार्यहरू।.
-
वेक वर्ड: पोर्क्युपिन सानो, सटीक छ, र प्रति-कीवर्ड संवेदनशीलता नियन्त्रणको साथ स्थानीय रूपमा चल्छ। [2]
-
ASR: Whisper एक बहुभाषी, सामान्य-उद्देश्य ASR मोडेल हो जुन ~६८० हजार घण्टामा प्रशिक्षित गरिएको छ; यो एक्सेन्ट/पृष्ठभूमि आवाजको लागि बलियो छ। उपकरणमा प्रयोगको लागि,
whisper.cpp लेएक दुबला C/C++ अनुमान मार्ग प्रदान गर्दछ। [3][4] -
ब्रेन: तपाईंको रोजाइ - API मार्फत क्लाउड LLM, नियम इन्जिन, वा अश्वशक्तिको आधारमा स्थानीय अनुमान।
-
TTS: पाइपरले स्थानीय रूपमा प्राकृतिक बोली उत्पन्न गर्छ, सामान्य हार्डवेयरमा द्रुत प्रतिक्रियाहरूको लागि पर्याप्त छिटो। [5]
द्रुत तुलना तालिका 🔎
| उपकरण | को लागि उत्तम | मूल्य-जस्तो | किन यो काम गर्छ |
|---|---|---|---|
| साँढे जगाउने शब्द | सधैं सुन्ने ट्रिगर | नि:शुल्क तह + | कम CPU, सटीक, सजिलो बाइन्डिङ [2] |
| व्हिस्पर.सीपीपी | पाईमा स्थानीय ASR | खुला स्रोत | राम्रो शुद्धता, CPU-मैत्री [4] |
| छिटो-फुसफुसाउने | CPU/GPU मा छिटो ASR | खुला स्रोत | CTranslate2 अप्टिमाइजेसनहरू |
| पाइपर TTS | स्थानीय बोली आउटपुट | खुला स्रोत | छिटो आवाज, धेरै भाषाहरू [5] |
| क्लाउड LLM API | समृद्ध तर्क | प्रयोगमा आधारित | हेभी कम्प्युट अफलोड गर्छ |
| नोड-रातो | व्यवस्थित कार्यहरू | खुला स्रोत | दृश्य प्रवाह, MQTT मैत्री |
चरणबद्ध निर्माण: तपाईंको पहिलो भ्वाइस लूप 🧩
हामी वेक वर्डको लागि पोर्कुपिन, ट्रान्सक्रिप्शनको लागि व्हिस्पर, रिप्लाईको लागि हल्का "ब्रेन" प्रकार्य (आफ्नो रोजाइको LLM ले बदल्नुहोस्), र स्पिचको लागि पाइपर प्रयोग गर्नेछौं। यसलाई न्यूनतम राख्नुहोस्, त्यसपछि दोहोर्याउनुहोस्।.
१) निर्भरताहरू स्थापना गर्नुहोस्
sudo apt install -y python3-pip portaudio19-dev sox ffmpeg pip3 install sounddevice numpy
-
साँढे: आफ्नो भाषाको लागि SDK/बाइन्डिङहरू लिनुहोस् र द्रुत सुरुवात (पहुँच कुञ्जी + किवर्ड सूची + अडियो फ्रेमहरू →
.process) पछ्याउनुहोस्। [2] -
व्हिस्पर (CPU-मैत्री): build whisper.cpp:
git क्लोन https://github.com/ggml-org/whisper.cpp cd whisper.cpp && cmake -B निर्माण && cmake --निर्माण निर्माण -j ./models/download-ggml-model.sh base.en ./build/bin/whisper-cli -m ./models/ggml-base.en.bin -f your.wav -otxt
माथिको कुराले परियोजनाको द्रुत सुरुवातलाई प्रतिबिम्बित गर्दछ। [4]
पाइथन मन पर्छ? सामान्य CPU हरूमा
faster-whisper(CTranslate2) प्रायः भेनिला पाइथन भन्दा छिटो हुन्छ।
२) पाइपर TTS सेटअप गर्नुहोस्
git clone https://github.com/rhasspy/piper cd piper make # तपाईंलाई मनपर्ने भ्वाइस मोडेल डाउनलोड गर्नुहोस्, जस्तै, en_US-amy "हेलो त्यहाँ।" इको गर्नुहोस् | ./piper --model voices/en/en_US-amy-medium.onnx --output_file hello.wav aplay hello.wav
पाइपर धेरै आवाज/भाषा विकल्पहरू भएको उपकरणमा रहेको TTS को लागि डिजाइन गरिएको हो। [5]
३) पाइथनमा न्यूनतम सहायक लूप
जानाजानी कम्प्याक्ट गरिएको: वेक वाक्यांश (स्टब) को लागि पर्खन्छ, रेकर्ड गर्छ, whisper.cpp, जवाफ (प्लेसहोल्डर) उत्पन्न गर्छ, त्यसपछि पाइपर मार्फत बोल्छ। प्लेसहोल्डरलाई आफ्नो मनपर्ने LLM वा नियम तर्कसँग स्वैप गर्छ।
os, subprocess, wave import sounddevice as sd आयात गर्नुहोस् WAKE_WORD = "hey computer" # उत्पादनमा रहेको Porcupine को लागि स्वाप गर्नुहोस् [2] RECORD_SECONDS = 6 SAMPLE_RATE = 16000 च्यानलहरू = 1 WORKDIR = "/home/pi/assistant" ASR_BIN = "/home/pi/whisper.cpp/build/bin/whisper-cli" # [4] ASR_MODEL = "/home/pi/whisper.cpp/models/ggml-base.en.bin" PIPER_BIN = "/home/pi/piper/build/piper" # [5] PIPER_VOICE = "/home/pi/piper/voices/en/en_US-amy-medium.onnx" os.makedirs(WORKDIR, exist_ok=True) def record_wav(path, seconds=RECORD_SECONDS): अडियो = sd.rec(int(seconds * SAMPLE_RATE), samplerate=SAMPLE_RATE, channels=CHANNELS, dtype='int16') sd.wait() wave.open(path, 'wb') को रूपमा w: w.setnchannels(CHANNELS); w.setsampwidth(2); w.setframerate(SAMPLE_RATE) w.writeframes(audio.tobytes()) def transcribe(path): cmd = [ASR_BIN, "-m", ASR_MODEL, "-f", path, "-otxt"] subprocess.run(cmd, check=True, cwd=WORKDIR) open(path.replace(".wav", ".txt"), "r", encoding="utf-8") लाई f को रूपमा फर्काउनुहोस्: f.read().strip() def generate_reply(prompt) फिर्ता गर्नुहोस्: यदि "weather" prompt.lower() मा छ भने: "म बादल देख्न सक्दिन, तर यो ठीक हुन सक्छ। यदि सम्भव छ भने ज्याकेट ल्याउनुहोस्।" "तपाईंले भन्नुभयो: " + प्रम्प्ट def speak(text): proc = subprocess.Popen([PIPER_BIN, "--model", PIPER_VOICE, "--output_file", f"{WORKDIR}/reply.wav"], stdin=subprocess.PIPE) proc.stdin.write(text.encode("utf-8")); proc.stdin.close(); proc.wait() subprocess.run(["aplay", f"{WORKDIR}/reply.wav"], check=True) print("सहायक तयार छ। परीक्षण गर्न वेक वाक्यांश टाइप गर्नुहोस्।") जबकि True: typed = input("> ").strip().lower() यदि टाइप गरिएको छ भने == WAKE_WORD: wav_path = f"{WORKDIR}/input.wav" record_wav(wav_path) text = transcribe(wav_path) reply = generate_reply(text) print("User:", text); print("सहायक:", reply) speak(reply) else: print("लूप परीक्षण गर्न वेक वाक्यांश टाइप गर्नुहोस्।")
वास्तविक वेक-वर्ड पत्ता लगाउनको लागि, पोर्क्युपाइनको स्ट्रिमिङ डिटेक्टर (कम CPU, प्रति-कीवर्ड संवेदनशीलता) एकीकृत गर्नुहोस्। [2]
वास्तवमा महत्त्वपूर्ण अडियो ट्युनिङ 🎚️
केही साना समाधानहरूले तपाईंको सहायकलाई १०× स्मार्ट महसुस गराउँछ:
-
माइकको दूरी: धेरै USB माइकहरूको लागि ३०-६० सेन्टिमिटर राम्रो हुन्छ।
-
स्तरहरू: इनपुटमा क्लिपिङ नगर्नुहोस् र प्लेब्याकलाई स्वस्थ राख्नुहोस्; कोड घोस्टहरूलाई पछ्याउनु अघि राउटिङ ठीक गर्नुहोस्। Raspberry Pi OS मा, तपाईंले प्रणाली उपकरणहरू वा
raspi-config। [1] -
कोठाको ध्वनिकी: कडा भित्ताहरूले प्रतिध्वनि निम्त्याउँछन्; माइक मुनि नरम म्याटले मद्दत गर्छ।
-
वेक वर्ड थ्रेसहोल्ड: धेरै संवेदनशील → घोस्ट ट्रिगरहरू; धेरै कडा → तपाईं प्लास्टिकमा चिच्याउनुहुनेछ। पोर्क्युपाइनले तपाईंलाई प्रति किवर्ड संवेदनशीलता ट्वीक गर्न दिन्छ। [2]
-
थर्मलहरू: Pi 5 मा लामो ट्रान्सक्रिप्शनहरूले दिगो कार्यसम्पादनको लागि आधिकारिक सक्रिय कूलरबाट फाइदा लिन्छ। [1]
खेलौनाबाट उपकरणमा जाँदै: सेवाहरू, अटोस्टार्ट, स्वास्थ्य जाँच 🧯
मानिसहरूले स्क्रिप्टहरू चलाउन बिर्सन्छन्। कम्प्युटरहरू राम्रो हुन बिर्सन्छन्। आफ्नो लूपलाई व्यवस्थित सेवामा बदल्नुहोस्:
-
systemd एकाइ सिर्जना गर्नुहोस्:
[युनिट] विवरण=DIY भ्वाइस असिस्टेन्ट After=network.target sound.target [सेवा] प्रयोगकर्ता=pi WorkingDirectory=/home/pi/assistant ExecStart=/usr/bin/python3 /home/pi/assistant/assistant.py रिस्टार्ट=सधैं रिस्टार्टसेक=३ [स्थापना गर्नुहोस्] WantedBy=multi-user.target
-
यसलाई सक्षम पार्नुहोस्:
sudo cp assistant.service /etc/systemd/system/ sudo systemctl डेमन-रिलोड sudo systemctl सक्षम गर्नुहोस् --अब सहायक.सर्भिस
-
काठको पुच्छर:
journalctl -u सहायक -f
अब यो बुट हुँदा सुरु हुन्छ, क्र्यास हुँदा पुन: सुरु हुन्छ, र सामान्यतया उपकरण जस्तै व्यवहार गर्छ। अलि बोरिंग, धेरै राम्रो।.
सीप प्रणाली: यसलाई घरमै उपयोगी बनाउनुहोस् 🏠✨
भ्वाइस-इन र भ्वाइस-आउट ठोस भएपछि, कार्यहरू थप्नुहोस्:
-
इन्टेन्ट राउटर: सामान्य कार्यहरूको लागि सरल किवर्ड रुटहरू।
-
स्मार्ट होम: MQTT मा घटनाहरू प्रकाशित गर्नुहोस् वा गृह सहायकको HTTP अन्त्य बिन्दुहरूमा कल गर्नुहोस्।
-
प्लगइनहरू: द्रुत पाइथन प्रकार्यहरू जस्तै
set_timer,what_is_the_time,play_radio,run_scene।
क्लाउड LLM लूपमा भए पनि, गति र विश्वसनीयताको लागि पहिले स्पष्ट स्थानीय आदेशहरू रुट गर्नुहोस्।.
स्थानीय मात्र बनाम क्लाउड असिस्ट: तपाईंले महसुस गर्नुहुनेछ 🌓
स्थानीय मात्र
फाइदाहरू: निजी, अफलाइन, अनुमानित लागतहरू।
बेफाइदाहरू: भारी मोडेलहरू साना बोर्डहरूमा ढिलो हुन सक्छन्। यदि तपाईंले यसलाई उपकरणमा वा नजिकैको सर्भरमा राख्नुभयो भने व्हिस्परको बहुभाषी प्रशिक्षणले बलियोपनमा मद्दत गर्दछ। [3]
क्लाउड असिस्ट
फाइदाहरू: शक्तिशाली तर्क, ठूला सन्दर्भ विन्डोजहरू।
बेफाइदाहरू: डेटाले उपकरण छोड्छ, नेटवर्क निर्भरता, परिवर्तनशील लागतहरू।
हाइब्रिडले प्रायः जित्छ: वेक वर्ड + ASR लोकल → तर्कको लागि API कल गर्नुहोस् → TTS लोकल। [2][3][5]
समस्या निवारण: अनौठो ग्रेम्लिन र द्रुत समाधानहरू 👾
-
वेक वर्ड गलत ट्रिगरहरू: संवेदनशीलता कम गर्नुहोस् वा फरक माइक प्रयास गर्नुहोस्। [2]
-
ASR lag : सानो Whisper मोडेल प्रयोग गर्नुहोस् वा रिलीज फ्ल्यागहरू (
-j --config Release) सहितwhisper.cppनिर्माण गर्नुहोस् । [4] -
चप्पी टीटीएस: सामान्य वाक्यांशहरू पूर्व-उत्पन्न गर्नुहोस्; आफ्नो अडियो उपकरण र नमूना दरहरू पुष्टि गर्नुहोस्।
-
कुनै माइक पत्ता लागेन:
arecord -lर मिक्सरहरू जाँच गर्नुहोस्। -
थर्मल थ्रोटलिङ: दिगो कार्यसम्पादनको लागि Pi 5 मा आधिकारिक सक्रिय कूलर प्रयोग गर्नुहोस्। [1]
तपाईंले पढ्नै पर्ने सुरक्षा र गोपनीयता नोटहरू 🔒
-
APT मार्फत आफ्नो Pi अपडेट राख्नुहोस्।.
-
यदि तपाईंले कुनै क्लाउड एपीआई प्रयोग गर्नुहुन्छ भने, तपाईंले पठाउनुभएको कुरा लग गर्नुहोस् र पहिले स्थानीय रूपमा व्यक्तिगत बिटहरू सम्पादन गर्ने विचार गर्नुहोस्।.
-
कम विशेषाधिकार भएका सेवाहरू चलाउनुहोस्; आवश्यक नभएसम्म ExecStart मा
sudoप्रयोग नगर्नुहोस्। -
पाहुनाहरू वा शान्त समयको लागि स्थानीय-मात्र मोड प्रदान गर्नुहोस् ।
भेरियन्टहरू बनाउनुहोस्: स्यान्डविच जस्तै मिलाउनुहोस् र मिलाउनुहोस् 🥪
-
अति-स्थानीय: पोर्क्युपाइन + whisper.cpp + पाइपर + सरल नियमहरू। निजी र बलियो। [2][4][5]
-
स्पीडी क्लाउड असिस्ट: पोर्क्युपिन + (सानो स्थानीय व्हिस्पर वा क्लाउड ASR) + TTS स्थानीय + क्लाउड LLM।
-
गृह स्वचालन केन्द्रीय: दिनचर्या, दृश्य र सेन्सरहरूको लागि नोड-रेड वा गृह सहायक प्रवाहहरू थप्नुहोस्।
उदाहरण सीप: MQTT मार्फत बत्ती बाल्ने 💡
mqtt को रूपमा paho.mqtt.client आयात गर्नुहोस् MQTT_HOST = "192.168.1.10" TOPIC = "home/livingroom/light/set" def set_light(state: str): client = mqtt.Client() client.connect(MQTT_HOST, 1883, 60) payload = "ON" यदि state.lower().startswith("on") else "OFF" client.publish(TOPIC, payload, qos=1, retain=False) client.disconnect() # यदि "बत्तीहरू खोल्नुहोस्" पाठमा: set_light("on")
"बैठक कोठाको बत्ती बाल्नुहोस्" जस्तो आवाजको लाइन थप्नुहोस्, र तपाईं जादूगर जस्तो महसुस गर्नुहुनेछ।.
यो स्ट्याक व्यवहारमा किन काम गर्छ 🧪
-
साना बोर्डहरूमा वेक-वर्ड पत्ता लगाउने काममा साँघुरो कुशल र सही हुन्छ, जसले गर्दा सधैं सुन्न सम्भव हुन्छ। [2]
-
व्हिस्परको ठूलो, बहुभाषी प्रशिक्षणले यसलाई विविध वातावरण र उच्चारणहरूमा बलियो बनाउँछ। [3]
-
whisper.cppले त्यो पावरलाई Pi जस्ता CPU-मात्र उपकरणहरूमा प्रयोग गर्न मिल्ने बनाउँछ। [4] -
पाइपरले क्लाउड TTS मा अडियो नपठाईकन प्रतिक्रियाहरूलाई छिटो राख्छ। [5]
धेरै लामो भयो, पढेको छैन
वेक वर्डको लागि पोर्क्युपाइन, ASR को लागि व्हिस्पर ( whisper.cpp मार्फत), जवाफको लागि तपाईंको दिमागको रोजाइ, र स्थानीय TTS को लागि पाइपर संयोजन गरेर Raspberry Pi सँग मोड्युलर, निजी DIY AI सहायक बनाउनुहोस् । यसलाई systemd सेवाको रूपमा बेर्नुहोस्, अडियो ट्युन गर्नुहोस्, र MQTT वा HTTP कार्यहरूमा तार गर्नुहोस्। यो तपाईंले सोचेभन्दा सस्तो छ, र बाँच्न अनौठो रूपमा रमाइलो छ। [1][2][3][4][5]
सन्दर्भ सामग्रीहरू
-
रास्पबेरी पाई सफ्टवेयर र कूलिंग - रास्पबेरी पाई इमेजर (डाउनलोड र प्रयोग) र पाई ५ एक्टिभ कूलर उत्पादन जानकारी
-
रास्पबेरी पाई इमेजर: थप पढ्नुहोस्
-
सक्रिय कूलर (Pi ५): थप पढ्नुहोस्
-
-
पोर्क्युपिन वेक वर्ड - SDK र द्रुत सुरुवात (कीवर्ड, संवेदनशीलता, स्थानीय अनुमान)
-
व्हिस्पर (ASR मोडेल) – बहुभाषिक, बलियो ASR ~६८० हजार घण्टामा प्रशिक्षित
-
र्याडफोर्ड एट अल., ठूलो-स्तरीय कमजोर पर्यवेक्षण (व्हिस्पर) मार्फत बलियो बोली पहिचान: थप पढ्नुहोस्
-
-
whisper.cpp – CLI र निर्माण चरणहरूसँग CPU-अनुकूल व्हिसपर अनुमान
-
पाइपर TTS - धेरै आवाजहरू/भाषाहरू सहितको द्रुत, स्थानीय तंत्रिका TTS