DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
Summary
DataOrchestra is a novel framework designed to optimize Large Language Model (LLM) pretraining data processing by orchestrating example-specific pipelines. Unlike existing methods that apply fixed strategies uniformly, DataOrchestra unifies various processing operations and decides for each data chunk whether to drop, untouch, or clean it. For cleaning, it selects one or more downstream operations, including programmatic editing or LLM-based rewriting, and generates concrete instructions for execution by tool models. Models pretrained from 0.5B to 7B on web data processed by DataOrchestra achieved stable average gains across 11 benchmarks compared to individual data-processing methods. The framework also proved effective for math continued pretraining, outperforming stronger baselines while reducing processing compute by skipping unnecessary operations.
Key takeaway
For ML engineers optimizing LLM pretraining data pipelines, you should consider adopting a dynamic, example-specific curation framework like DataOrchestra. This approach can yield stable performance gains across 11 benchmarks for models from 0.5B to 7B and reduce processing compute compared to uniform strategies, especially for specialized tasks like math pretraining. Evaluate its integration to enhance both model quality and operational efficiency.
Key insights
DataOrchestra dynamically curates pretraining data per-example, unifying operations for improved LLM performance and efficiency.
Principles
- Per-example data processing outperforms fixed strategies.
- Orchestrating diverse operations optimizes data curation.
- Skipping unnecessary steps reduces compute.
Method
DataOrchestra's orchestrator decides to drop, untouch, or clean data chunks. For cleaning, it selects programmatic or LLM-based rewriting operations, generating specific instructions for tool models.
In practice
- Apply dynamic data curation to LLM pretraining.
- Integrate diverse processing tools via an orchestrator.
- Optimize compute by conditional data processing.
Topics
- Pretraining Data Curation
- Large Language Models
- Data Orchestration
- Machine Learning Pipelines
- Computational Efficiency
- Benchmarking
Best for: Research Scientist, AI Engineer, AI Scientist, Machine Learning Engineer, NLP Engineer
Related on AIssential
See Counsel's argued verdicts on the open AI decisions leaders are weighing →
Editorial summary, takeaway, and curation by AIssential. Original article published by Computation and Language.