Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Datasets:
Scicom-intl
/
Multilingual-Normalizer
Like
0
Follow
Scicom (MSC) BHD
33
Tasks:
Text Generation
Modalities:
Text
Formats:
json
Languages:
English
Malay
Indonesian
+ 12
Size:
100K - 1M
Tags:
text-normalization
tts
inverse-text-normalization
code-switching
malaysia
Libraries:
Datasets
pandas
Polars
+ 1
Dataset card
Data Studio
Files
Files and versions
xet
Community
main
Multilingual-Normalizer
/
raw
21.4 MB
1 contributor
History:
1 commit
huseinzolkepliscicom
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
b1c3b5f
verified
9 days ago
llm_pairs.jsonl
Safe
1.79 MB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
9 days ago
llm_sentences.jsonl
Safe
748 kB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
9 days ago
template_pairs.jsonl
18.6 MB
xet
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
9 days ago
templates_llm.jsonl
Safe
246 kB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
9 days ago