datatrove —— FineWeb、FineWeb2 和 FinePDFs 背后的数据处理库 —— 刚刚发布了 0.10.0!
datatrove —— FineWeb、FineWeb2 和 FinePDFs 背后的数据处理库 —— 刚刚发布了 0.10.0! - JobsPipelineExecutor:在 @huggingface Jobs 上运行流水线:扇出、多阶段依赖、重试、断点续作。无需 Slurm 集群 - 将 HF 存储桶用作 DataFolder:
所有带有「vanstriendaniel」标签的 AI 情报。
3 条情报datatrove —— FineWeb、FineWeb2 和 FinePDFs 背后的数据处理库 —— 刚刚发布了 0.10.0! - JobsPipelineExecutor:在 @huggingface Jobs 上运行流水线:扇出、多阶段依赖、重试、断点续作。无需 Slurm 集群 - 将 HF 存储桶用作 DataFolder:
Many AI tasks can now run fully local or on-device. - Redact PII in the browser: OpenAI privacy-filter (1.5B) - Streaming speech-to-text: Nemotron-3.5 ASR (0.6B) - Parse documents: OvisOCR2 (0.9B) - Run agent loops: LFM2
Uploaded a dataset of 1,080,814 public domain images, mostly from 19th-century books, to the Hub. https:// huggingface.co/datasets/bigla m/british-library-book-images …