sherpa_onnx library
Classes
- AudioEvent
- One predicted audio event.
- AudioTagging
- Offline audio tagger.
- AudioTaggingConfig
- Top-level configuration for AudioTagging.
- AudioTaggingModelConfig
- Aggregate model configuration for audio tagging.
- CircularBuffer
- Circular sample buffer used by VAD-related pipelines.
- DenoisedAudio
- Audio returned by offline or online speech denoisers.
- FastClusteringConfig
- Clustering options used after segmentation and embedding extraction.
- FeatureConfig
- Feature extraction settings shared by recognizers and keyword spotting.
- GeneratedAudio
- Audio generated by OfflineTts.
- HomophoneReplacerConfig
- Optional resources for homophone replacement during decoding.
- KeywordResult
- Result returned by KeywordSpotter.getResult.
- KeywordSpotter
- Streaming keyword spotter.
- KeywordSpotterConfig
- Streaming keyword spotting.
- OfflineCanaryModelConfig
- Model files and translation options for NeMo Canary.
- OfflineCohereTranscribeModelConfig
- Model files and text options for Cohere Transcribe.
- OfflineDolphinModelConfig
- Model files for an offline Dolphin recognizer.
- OfflineFireRedAsrCtcModelConfig
- Model files for the Fire-Red-ASR CTC recognizer.
- OfflineFireRedAsrModelConfig
- Model files for the Fire-Red-ASR transducer recognizer.
- OfflineFunAsrNanoModelConfig
- Model files and prompt settings for FunASR-Nano.
- OfflineLMConfig
- Optional external language model settings for offline ASR.
- OfflineMedAsrCtcModelConfig
- Model files for the MedASR CTC recognizer.
- OfflineModelConfig
- Aggregate model configuration for offline recognition.
- OfflineMoonshineModelConfig
- Model files for Moonshine v1 or v2.
- OfflineNemoEncDecCtcModelConfig
- Model files for an offline NeMo CTC recognizer.
- OfflineOmnilingualAsrCtcModelConfig
- Model files for the omnilingual ASR CTC recognizer.
- OfflineParaformerModelConfig
- Model files for an offline Paraformer recognizer.
- OfflinePunctuation
- Offline punctuation restorer.
- OfflinePunctuationConfig
- Top-level configuration for OfflinePunctuation.
- OfflinePunctuationModelConfig
- Offline punctuation restoration.
- OfflineQwen3AsrModelConfig
- OfflineRecognizer
- Offline speech recognizer.
- OfflineRecognizerConfig
- Top-level configuration for OfflineRecognizer.
- OfflineRecognizerResult
- Recognition result returned by OfflineRecognizer.getResult.
- OfflineSenseVoiceModelConfig
- Model files and options for SenseVoice.
- OfflineSpeakerDiarization
- Offline speaker diarizer.
- OfflineSpeakerDiarizationConfig
- Top-level configuration for OfflineSpeakerDiarization.
- OfflineSpeakerDiarizationSegment
- Offline speaker diarization.
- OfflineSpeakerSegmentationModelConfig
- Segmentation model configuration for speaker diarization.
- OfflineSpeakerSegmentationPyannoteModelConfig
- Pyannote segmentation model path.
- OfflineSpeechDenoiser
- Offline speech denoiser.
- OfflineSpeechDenoiserConfig
- Top-level configuration for OfflineSpeechDenoiser.
- OfflineSpeechDenoiserDpdfNetModelConfig
- DPDFNet model path for offline speech denoising.
- OfflineSpeechDenoiserGtcrnModelConfig
- Offline speech denoising.
- OfflineSpeechDenoiserModelConfig
- Aggregate model configuration for OfflineSpeechDenoiser.
- OfflineStream
- Input stream for offline APIs such as offline ASR, audio tagging, and spoken language identification.
- OfflineTdnnModelConfig
- Model files for an offline TDNN recognizer.
- OfflineTransducerModelConfig
- Offline speech recognition.
- OfflineTts
- Offline text-to-speech engine.
- OfflineTtsConfig
- Top-level configuration for OfflineTts.
- OfflineTtsGenerationConfig
- Offline text-to-speech.
- OfflineTtsKittenModelConfig
- Kitten model configuration.
- OfflineTtsKokoroModelConfig
- Kokoro model configuration.
- OfflineTtsMatchaModelConfig
- Matcha model configuration.
- OfflineTtsModelConfig
- Aggregate model configuration for offline TTS.
- OfflineTtsPocketModelConfig
- Pocket TTS model configuration.
- OfflineTtsSupertonicModelConfig
- Supertonic model configuration.
- OfflineTtsVitsModelConfig
- VITS model configuration.
- OfflineTtsZipVoiceModelConfig
- ZipVoice model configuration.
- OfflineWenetCtcModelConfig
- Model files for an offline WeNet CTC recognizer.
- OfflineWhisperModelConfig
- Model files and options for an offline Whisper recognizer.
- OfflineZipformerAudioTaggingModelConfig
- Offline audio tagging.
- OfflineZipformerCtcModelConfig
- Model files for an offline Zipformer CTC recognizer.
- OnlineCtcFstDecoderConfig
- FST decoder settings for CTC-based streaming recognition.
- OnlineModelConfig
- Aggregate model configuration for streaming recognition.
- OnlineNemoCtcModelConfig
- Model file for a streaming NeMo CTC recognizer.
- OnlineParaformerModelConfig
- Model files for a streaming Paraformer recognizer.
- OnlinePunctuation
- Online punctuation restorer.
- OnlinePunctuationConfig
- Top-level configuration for OnlinePunctuation.
- OnlinePunctuationModelConfig
- Online punctuation restoration.
- OnlineRecognizer
- Streaming speech recognizer.
- OnlineRecognizerConfig
- Top-level configuration for OnlineRecognizer.
- OnlineRecognizerResult
- Streaming recognition result returned by OnlineRecognizer.getResult.
- OnlineSpeechDenoiser
- Streaming speech denoiser.
- OnlineSpeechDenoiserConfig
- Streaming speech denoising.
- OnlineStream
- Input stream for streaming APIs such as online ASR and keyword spotting.
- OnlineToneCtcModelConfig
- Model file for a streaming tone-aware CTC recognizer.
- OnlineTransducerModelConfig
- Streaming speech recognition.
- OnlineZipformer2CtcModelConfig
- Model file for a streaming Zipformer2 CTC recognizer.
- SileroVadModelConfig
- Voice activity detection and buffering helpers.
- SpeakerEmbeddingExtractor
- Speaker embedding extractor.
- SpeakerEmbeddingExtractorConfig
- Speaker embedding extraction and speaker identification utilities.
- SpeakerEmbeddingManager
- In-memory store of named speaker embeddings.
- SpeechSegment
- One detected speech segment emitted by VoiceActivityDetector.
- SpokenLanguageIdentification
- Spoken language identifier.
- SpokenLanguageIdentificationConfig
- Top-level configuration for SpokenLanguageIdentification.
- SpokenLanguageIdentificationResult
- Result returned by SpokenLanguageIdentification.compute.
- SpokenLanguageIdentificationWhisperConfig
- Spoken language identification.
- TenVadModelConfig
- Ten VAD model configuration.
- VadModelConfig
- Top-level VAD model configuration.
- VoiceActivityDetector
- Voice activity detector that emits SpeechSegment objects.
- WaveData
- Audio samples loaded from a WAV file.
Functions
-
getGitDate(
) → String - Return the Git date of the native library build.
-
getGitSha1(
) → String - Return the Git SHA1 of the native library build.
-
getVersion(
) → String - Return the sherpa-onnx version string compiled into the native library.
-
initBindings(
[String? p]) → void - Initialize the native sherpa-onnx bindings.
-
readWave(
String filename) → WaveData - Read a WAV file from disk.
-
writeWave(
{required String filename, required Float32List samples, required int sampleRate}) → bool - Write normalized mono PCM samples to a WAV file.