Instructions to use HuggingFaceTB/cosmo2-tokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use HuggingFaceTB/cosmo2-tokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("HuggingFaceTB/cosmo2-tokenizer", dtype="auto") - Notebooks
- Google Colab
- Kaggle
metadata
library_name: transformers
datasets:
- HuggingFaceTB/cosmo2_training_data_subset_1M
cosmo2-tokenizer
Tokenizer for the training of cosmo2. This tokenizer was trained on 1M samples from:
- FineWeb-Edu 70%
- Cosmopedia v2 15%
- StarCoderData 8%
- OpenWebMath 5%
- StackOverFlow 2%