Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Datasets:
Scicom-intl
/
Multilingual-Normalizer
Like
0
Follow
Scicom (MSC) BHD
32
Tasks:
Text Generation
Modalities:
Text
Formats:
json
Languages:
English
Malay
Indonesian
+ 12
Size:
100K - 1M
Tags:
text-normalization
tts
inverse-text-normalization
code-switching
malaysia
Libraries:
Datasets
pandas
Polars
+ 1
Dataset card
Data Studio
Files
Files and versions
xet
Community
main
Multilingual-Normalizer
113 MB
1 contributor
History:
4 commits
huseinzolkepliscicom
uniform row schema across template and llm rows (loadable with datasets)
7976ab7
verified
7 days ago
raw
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago
.gitattributes
Safe
2.67 kB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago
README.md
Safe
8.8 kB
card: valid task category
7 days ago
stats.md
Safe
2.58 kB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago
test.jsonl
Safe
1.17 MB
uniform row schema across template and llm rows (loadable with datasets)
7 days ago
test_sft.jsonl
Safe
3.77 MB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago
train.jsonl
Safe
19.4 MB
xet
uniform row schema across template and llm rows (loadable with datasets)
7 days ago
train_sft.jsonl
62.9 MB
xet
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago
val.jsonl
Safe
1.09 MB
uniform row schema across template and llm rows (loadable with datasets)
7 days ago
val_sft.jsonl
Safe
3.52 MB
Multilingual TTS normalizer dataset: 52,698 written->spoken pairs, 16 locales + 6 Malaysian code-switched pairs
7 days ago