sherpa_onnx library

Classes

AudioEvent
One predicted audio event.
AudioTagging
Offline audio tagger.
AudioTaggingConfig
Top-level configuration for AudioTagging.
AudioTaggingModelConfig
Aggregate model configuration for audio tagging.
CircularBuffer
Circular sample buffer used by VAD-related pipelines.
DenoisedAudio
Audio returned by offline or online speech denoisers.
FastClusteringConfig
Clustering options used after segmentation and embedding extraction.
FeatureConfig
Feature extraction settings shared by recognizers and keyword spotting.
GeneratedAudio
Audio generated by OfflineTts.
HomophoneReplacerConfig
Optional resources for homophone replacement during decoding.
KeywordResult
Result returned by KeywordSpotter.getResult.
KeywordSpotter
Streaming keyword spotter.
KeywordSpotterConfig
Streaming keyword spotting.
OfflineCanaryModelConfig
Model files and translation options for NeMo Canary.
OfflineCohereTranscribeModelConfig
Model files and text options for Cohere Transcribe.
OfflineDolphinModelConfig
Model files for an offline Dolphin recognizer.
OfflineFireRedAsrCtcModelConfig
Model files for the Fire-Red-ASR CTC recognizer.
OfflineFireRedAsrModelConfig
Model files for the Fire-Red-ASR transducer recognizer.
OfflineFunAsrNanoModelConfig
Model files and prompt settings for FunASR-Nano.
OfflineLMConfig
Optional external language model settings for offline ASR.
OfflineMedAsrCtcModelConfig
Model files for the MedASR CTC recognizer.
OfflineModelConfig
Aggregate model configuration for offline recognition.
OfflineMoonshineModelConfig
Model files for Moonshine v1 or v2.
OfflineNemoEncDecCtcModelConfig
Model files for an offline NeMo CTC recognizer.
OfflineOmnilingualAsrCtcModelConfig
Model files for the omnilingual ASR CTC recognizer.
OfflineParaformerModelConfig
Model files for an offline Paraformer recognizer.
OfflinePunctuation
Offline punctuation restorer.
OfflinePunctuationConfig
Top-level configuration for OfflinePunctuation.
OfflinePunctuationModelConfig
Offline punctuation restoration.
OfflineQwen3AsrModelConfig
OfflineRecognizer
Offline speech recognizer.
OfflineRecognizerConfig
Top-level configuration for OfflineRecognizer.
OfflineRecognizerResult
Recognition result returned by OfflineRecognizer.getResult.
OfflineSenseVoiceModelConfig
Model files and options for SenseVoice.
OfflineSpeakerDiarization
Offline speaker diarizer.
OfflineSpeakerDiarizationConfig
Top-level configuration for OfflineSpeakerDiarization.
OfflineSpeakerDiarizationSegment
Offline speaker diarization.
OfflineSpeakerSegmentationModelConfig
Segmentation model configuration for speaker diarization.
OfflineSpeakerSegmentationPyannoteModelConfig
Pyannote segmentation model path.
OfflineSpeechDenoiser
Offline speech denoiser.
OfflineSpeechDenoiserConfig
Top-level configuration for OfflineSpeechDenoiser.
OfflineSpeechDenoiserDpdfNetModelConfig
DPDFNet model path for offline speech denoising.
OfflineSpeechDenoiserGtcrnModelConfig
Offline speech denoising.
OfflineSpeechDenoiserModelConfig
Aggregate model configuration for OfflineSpeechDenoiser.
OfflineStream
Input stream for offline APIs such as offline ASR, audio tagging, and spoken language identification.
OfflineTdnnModelConfig
Model files for an offline TDNN recognizer.
OfflineTransducerModelConfig
Offline speech recognition.
OfflineTts
Offline text-to-speech engine.
OfflineTtsConfig
Top-level configuration for OfflineTts.
OfflineTtsGenerationConfig
Offline text-to-speech.
OfflineTtsKittenModelConfig
Kitten model configuration.
OfflineTtsKokoroModelConfig
Kokoro model configuration.
OfflineTtsMatchaModelConfig
Matcha model configuration.
OfflineTtsModelConfig
Aggregate model configuration for offline TTS.
OfflineTtsPocketModelConfig
Pocket TTS model configuration.
OfflineTtsSupertonicModelConfig
Supertonic model configuration.
OfflineTtsVitsModelConfig
VITS model configuration.
OfflineTtsZipVoiceModelConfig
ZipVoice model configuration.
OfflineWenetCtcModelConfig
Model files for an offline WeNet CTC recognizer.
OfflineWhisperModelConfig
Model files and options for an offline Whisper recognizer.
OfflineZipformerAudioTaggingModelConfig
Offline audio tagging.
OfflineZipformerCtcModelConfig
Model files for an offline Zipformer CTC recognizer.
OnlineCtcFstDecoderConfig
FST decoder settings for CTC-based streaming recognition.
OnlineModelConfig
Aggregate model configuration for streaming recognition.
OnlineNemoCtcModelConfig
Model file for a streaming NeMo CTC recognizer.
OnlineParaformerModelConfig
Model files for a streaming Paraformer recognizer.
OnlinePunctuation
Online punctuation restorer.
OnlinePunctuationConfig
Top-level configuration for OnlinePunctuation.
OnlinePunctuationModelConfig
Online punctuation restoration.
OnlineRecognizer
Streaming speech recognizer.
OnlineRecognizerConfig
Top-level configuration for OnlineRecognizer.
OnlineRecognizerResult
Streaming recognition result returned by OnlineRecognizer.getResult.
OnlineSpeechDenoiser
Streaming speech denoiser.
OnlineSpeechDenoiserConfig
Streaming speech denoising.
OnlineStream
Input stream for streaming APIs such as online ASR and keyword spotting.
OnlineToneCtcModelConfig
Model file for a streaming tone-aware CTC recognizer.
OnlineTransducerModelConfig
Streaming speech recognition.
OnlineZipformer2CtcModelConfig
Model file for a streaming Zipformer2 CTC recognizer.
SileroVadModelConfig
Voice activity detection and buffering helpers.
SpeakerEmbeddingExtractor
Speaker embedding extractor.
SpeakerEmbeddingExtractorConfig
Speaker embedding extraction and speaker identification utilities.
SpeakerEmbeddingManager
In-memory store of named speaker embeddings.
SpeechSegment
One detected speech segment emitted by VoiceActivityDetector.
SpokenLanguageIdentification
Spoken language identifier.
SpokenLanguageIdentificationConfig
Top-level configuration for SpokenLanguageIdentification.
SpokenLanguageIdentificationResult
Result returned by SpokenLanguageIdentification.compute.
SpokenLanguageIdentificationWhisperConfig
Spoken language identification.
TenVadModelConfig
Ten VAD model configuration.
VadModelConfig
Top-level VAD model configuration.
VoiceActivityDetector
Voice activity detector that emits SpeechSegment objects.
WaveData
Audio samples loaded from a WAV file.

Functions

getGitDate() String
Return the Git date of the native library build.
getGitSha1() String
Return the Git SHA1 of the native library build.
getVersion() String
Return the sherpa-onnx version string compiled into the native library.
initBindings([String? p]) → void
Initialize the native sherpa-onnx bindings.
readWave(String filename) WaveData
Read a WAV file from disk.
writeWave({required String filename, required Float32List samples, required int sampleRate}) bool
Write normalized mono PCM samples to a WAV file.