Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

Datasets:
Scicom-intl
/
Multilingual-Normalizer

Tasks:
Text Generation
Modalities:
Text
Formats:
json
Languages:
English
Malay
Indonesian
Size:
100K - 1M
Tags:
text-normalization
tts
inverse-text-normalization
code-switching
malaysia
Libraries:
Datasets
pandas
Polars
Dataset card Data Studio Files Files and versions
xet
Community
Multilingual-Normalizer / raw
21.4 MB
  • 1 contributor
History: 1 commit
huseinzolkepliscicom's picture
huseinzolkepliscicom
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
b1c3b5f verified 9 days ago
  • llm_pairs.jsonl
    1.79 MB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 9 days ago
  • llm_sentences.jsonl
    748 kB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 9 days ago
  • template_pairs.jsonl
    18.6 MB
    xet
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 9 days ago
  • templates_llm.jsonl
    246 kB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 9 days ago