{"data":{"kind":"file","path":"README.md","version_id":"jinsx8y6mvzii16ckf7cuoom","entry":{"name":"README.md","path":"README.md","is_directory":false,"size":927,"modified_at":"2026-08-08T14:10:57.372000","content_hash":"2fe3cb028652cfa0b5ed3fca4d9f66e5cfb2c9906972780a0685530a91fca4db"},"entries":[],"content":"# Data Cleaning Pipeline\n\nEvaluates an LLM's ability to build robust data cleaning pipelines in Python.\n\n## Task\n\nGiven a messy dataset description and sample data, the model must produce a complete Python data cleaning function that handles:\n\n- Missing values (NaN, None, empty strings)\n- Duplicate rows\n- Data type conversions\n- Outlier detection and handling\n- String normalization (whitespace, case, encoding)\n- Column renaming and standardization\n\n## Scoring\n\n| Metric | Weight | Description |\n|--------|--------|-------------|\n| Correctness | 0.30 | Code is syntactically valid and uses pandas properly |\n| Completeness | 0.25 | Handles all mentioned data quality issues |\n| Robustness | 0.25 | Includes error handling, edge cases, logging |\n| Best Practices | 0.20 | Idiomatic pandas, vectorized ops, docstrings |\n\n## Usage\n\n```python\nimport verifiers as vf\nenv = vf.load_environment(\"titsi/data-cleaning-pipeline\")\n```\n","encoding":"utf-8","truncated":false,"total_bytes":927},"status":null}