AIAIAny
  • Search
  • Collection
  • Category
  • Tag
  • Daily AI
AIAIAny

Category

Explore by categories

AIAIAny

Curated AI Resources for Everyone

[email protected]

Powered by airss.app

Product
  • Search
  • Collection
  • Category
  • Tag
Resources
  • Blog
Company
  • Privacy Policy
  • Terms of Service
  • Sitemap
Copyright © 2026 All Rights Reserved.
  • All Categories

  • AI Leaderboard

  • AI Agent Tutorials

  • AI Coding Tutorials

  • AI Model

  • AI Agent Papers

  • Chatbot

  • AI Dataset

  • Machine Learning Foundation Books

  • AI Train

  • AI Deploy

  • AI Client

  • Machine Learning Foundation Papers

  • Machine Learning Foundation Tutorials

  • AI Image Demos

  • AI Agent

  • Large Language Model Tutorials

  • Large Language Model Papers

  • Machine Learning Engineering Papers

  • Computer Vision Tutorials

  • Computer Vision Papers

  • Natural Language Processing Papers

  • Reinforcement Learning Papers

  • Speech Technology Papers

  • AI API

  • AI Coding

  • AI Image

  • AI Video

  • MLOps

  • MCP Client

  • MCP Server

  • AI Video Papers

  • AI Audio

  • AI Others

  • AI Infra

  • Embodied AI

Hugging Face
AI Model·2026
Icon for item

OmniVoice

k2-fsa, Han Zhu +9

Converts text to natural-sounding speech across 600+ languages in a zero-shot way, with short-reference voice cloning and fine-grained voice-design controls; uses a diffusion language-model-style architecture to balance quality and very low inference latency.

#multilingual#speech#audio#huggingface#github+2
GitHub
AI Audio·2026
Icon for item

transcribe.cpp

handy-computer, Mozilla AI +3

Runs local speech-to-text inference for a wide range of ASR model families using GGUF models on the ggml runtime. Supports Metal, Vulkan, and CUDA GPU backends plus a tinyBLAS-accelerated CPU path, prebuilt GGUFs on Hugging Face, and a quantization tool.

#stt#speech#ai-inference#huggingface#cuda+7
GitHub
AI Audio·2026
Icon for item

OmniVoice Studio

Palash Debnath·palash.dev

Desktop app for local voice cloning, real-time dictation, and end-to-end video dubbing using zero-shot TTS across 600+ languages; features multi-engine TTS/ASR, speaker diarization, vocal isolation, batch pipelines, and invisible audio watermarking — all run fully offline.

#voice#audio#tts#stt#speech+9
Hugging Face
AI Audio·2026
Icon for item

Dramabox

ResembleAI

Generates expressive, prompt-driven text-to-speech audio with optional 10-second voice cloning; prompts control speaker identity, emotion, pauses and nonverbal sounds. An IC‑LoRA fine-tune of LTX‑2.3 that applies an imperceptible Resemble Perth watermark.

#audio#speech#huggingface#gemma#ai-demos+2
Hugging Face
AI Audio·2026
Icon for item

Scenema Audio

ScenemaAI

Generates expressive, scene-aware speech from XML-style prompts and supports zero-shot voice cloning from 10–20s references. Produces emotional acting, ambient SFX, multilingual output, and continuous long-form narration; requires large model weights and gated Gemma text-encoder access.

#audio#multilingual#transformers#ai-api#AIGC
Hugging Face
AI Audio·2026
Icon for item

Supertone/supertonic-3

Supertone

Converts text into natural-sounding speech locally using compact ONNX TTS assets. Optimized for CPU/edge inference (~99M params) with support for 31 languages, expression tags (e.g., <laugh>), and improved stability versus Supertonic 2 — suitable for on-device multilingual TTS.

#multilingual#audio#speech#huggingface#python+3
Hugging Face
AI Audio·2026
Icon for item

Irodori-TTS-500M-v3

Aratako (Chihiro Arata)

Generates high-quality Japanese speech from text with zero-shot voice cloning and emoji-based style controls; uses a flow-matching diffusion transformer over DACVAE continuous latents, includes a duration predictor and integrated SilentCipher watermarking. Japanese-only.

#speech#voice#audio#transformers#pytorch+1
Hugging Face
AI Model·2026
Icon for item

Nemotron 3.5 ASR

NVIDIA

Multilingual streaming ASR that transcribes 40 language-locales using a cache-aware FastConformer‑RNNT architecture. Supports language-ID prompting (or auto-detect), punctuation/capitalization, and configurable chunk sizes to trade latency vs. accuracy for production transcription and streaming voice agents.

#nvidia#huggingface#ASR#speech#multilingual+3
Hugging Face
AI Audio·2026
Icon for item

stabilityai/stable-audio-3-medium

stabilityai

Generates music, sound effects, and general audio from text prompts using a medium-size Stable Audio 3 diffusion model — a balance of generation quality and inference cost suitable for prototyping, demo assets, and creative sound design workflows.

#audio#speech#AIGC#foundation-model#ai-tools+1
Hugging Face
AI Audio·2026
Icon for item

MOSS-Transcribe-Diarize

OpenMOSS-Team, MOSI.AI +1

Converts long-form multi-speaker audio/video into a compact, speaker-aware transcript with timestamps and anonymous speaker labels in one pass. Combines ASR and diarization in a single model, supports custom prompts/hotwords, and targets meetings, podcasts, interviews and long recordings.

#ASR#audio#speech#stt#transformers+5
Hugging Face
AI Model·2026
Icon for item

Miso TTS 8B

MisoLabs

Generates conversational speech and voice continuation from text and optional audio context, outputting Mimi audio codes. Built on a Sesame-style CSM with an 8B Llama-like backbone plus a smaller autoregressive audio decoder. Suited for local TTS inference and voice-cloning workflows.

#pytorch#audio#voice#speech#huggingface+1
Hugging Face
AI Audio·2026
Icon for item

MOSS-TTS-v1.5

OpenMOSS-Team

Generates multilingual text-to-speech with zero-shot voice cloning, token-level duration control, and inline pause markers. v1.5 improves multilingual fidelity (with language tags), cloning stability, and long-reference handling—suitable for research and production TTS pipelines.

#speech#audio#voice#multilingual#huggingface+2
  • Previous
  • 1
  • 2
  • 3
  • 4
  • 5
  • 6
  • Next