Instructions to use adityaghai07/ag_hindi_bpe_tokenizer_32k with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use adityaghai07/ag_hindi_bpe_tokenizer_32k with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("adityaghai07/ag_hindi_bpe_tokenizer_32k", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Hindi BPE Tokenizer (32K)
Character-level BPE tokenizer for Hindi (Devanagari script) with Metaspace pre-tokenization. Trained on Hindi Wikipedia.
- Vocab size: 32,000
- Algorithm: BPE with Metaspace
- Training data: Hindi Wikipedia (~519 MB, 688K lines)
- Normalization: Unicode NFC
- Special tokens:
<|pad|><|bos|><|eos|><|unk|><|sep|><|mask|><|user|><|assistant|>
Fertility ~1.5-1.8 tokens/word vs ~6-8 for GPT-2 on Hindi text. Preserves Devanagari conjuncts, matras, and combining marks. Handles code-mixed Hindi-English.
Usage
from transformers import PreTrainedTokenizerFast
tokenizer = PreTrainedTokenizerFast.from_pretrained("adityaghai07/ag_hindi_bpe_tokenizer_32k")
ids = tokenizer.encode("भारत एक महान देश है।")
print(tokenizer.decode(ids))
Source
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support