Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

Datasets:
Scicom-intl
/
Multilingual-Normalizer

Tasks:
Text Generation
Modalities:
Text
Formats:
json
Languages:
English
Malay
Indonesian
Size:
100K - 1M
Tags:
text-normalization
tts
inverse-text-normalization
code-switching
malaysia
Libraries:
Datasets
pandas
Polars
Dataset card Data Studio Files Files and versions
xet
Community
Multilingual-Normalizer
113 MB
  • 1 contributor
History: 4 commits
huseinzolkepliscicom's picture
huseinzolkepliscicom
uniform row schema across template and llm rows (loadable with datasets)
7976ab7 verified 7 days ago
  • raw
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago
  • .gitattributes
    2.67 kB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago
  • README.md
    8.8 kB
    card: valid task category 7 days ago
  • stats.md
    2.58 kB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago
  • test.jsonl
    1.17 MB
    uniform row schema across template and llm rows (loadable with datasets) 7 days ago
  • test_sft.jsonl
    3.77 MB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago
  • train.jsonl
    19.4 MB
    xet
    uniform row schema across template and llm rows (loadable with datasets) 7 days ago
  • train_sft.jsonl
    62.9 MB
    xet
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago
  • val.jsonl
    1.09 MB
    uniform row schema across template and llm rows (loadable with datasets) 7 days ago
  • val_sft.jsonl
    3.52 MB
    Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs 7 days ago