All skills
davila7 avatar

/data-processing-nemo-curator

@d9d759e

GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.

  • 3 files
  • 13.5 KB
  • MIT
  • Updated 9 months ago
  • GitHub

Use this Skill: https://skilld.dev/gh/davila7/claude-code-templates/data-processing-nemo-curator

This session only. Nothing lands on disk.

referencesdeduplication.md

≈536 tokens on demand. Your agent reads this file only when SKILL.md points to it.

Deduplication Guide

Complete guide to exact, fuzzy, and semantic deduplication.

Exact deduplication

Remove documents with identical content.

from nemo_curator.modules import ExactDuplicates

# Exact deduplication
exact_dedup = ExactDuplicates(
    id_field="id",
    text_field="text",
    hash_method="md5"  # or "sha256"
)

deduped = exact_dedup(dataset)

Performance: ~16× faster on GPU vs CPU

Fuzzy deduplication

Remove near-duplicate documents using MinHash + LSH.

from nemo_curator.modules import FuzzyDuplicates

fuzzy_dedup = FuzzyDuplicates(
    id_field="id",
    text_field="text",
    num_hashes=260,        # MinHash permutations (more = accurate)
    num_buckets=20,        # LSH buckets (more = faster, less recall)
    hash_method="md5",
    jaccard_threshold=0.8  # Similarity threshold
)

deduped = fuzzy_dedup(dataset)

Parameters:

  • num_hashes: 128-512 (default 260)
  • num_buckets: 10-50 (default 20)
  • jaccard_threshold: 0.7-0.9 (default 0.8)

Performance: 16× faster on 8TB dataset (120h → 7.5h)

Semantic deduplication

Remove semantically similar documents using embeddings.

from nemo_curator.modules import SemanticDuplicates

semantic_dedup = SemanticDuplicates(
    id_field="id",
    text_field="text",
    embedding_model="sentence-transformers/all-MiniLM-L6-v2",
    embedding_batch_size=256,
    threshold=0.85,  # Cosine similarity threshold
    device="cuda"
)

deduped = semantic_dedup(dataset)

Models:

  • all-MiniLM-L6-v2: Fast, 384 dims
  • all-mpnet-base-v2: Better quality, 768 dims
  • Custom models supported

Comparison

Method Speed Recall Use Case
Exact Fastest 100% Exact matches only
Fuzzy Fast ~95% Near-duplicates (recommended)
Semantic Slow ~90% Paraphrases, rewrites

Best practices

  1. Start with exact dedup - Remove obvious duplicates
  2. Use fuzzy for large datasets - Best speed/quality trade-off
  3. Semantic for high-value data - Expensive but thorough
  4. GPU acceleration required - 10-16× speedup

Source: SKILL.md on GitHub

No third-party reports yet.

Signed by skilld at d9d759e. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub 15 hours ago.

Activeupdated 9 months ago
version
1.0.0
author
Orchestra Research
dependencies
[
  "nemo-curator",
  "cudf",
  "dask",
  "rapids"
]
Other metadata
tags
[
  "Data Processing",
  "NeMo Curator",
  "Data Curation",
  "GPU Acceleration",
  "Deduplication",
  "Quality Filtering",
  "NVIDIA",
  "RAPIDS",
  "PII Redaction",
  "Multimodal",
  "LLM Training Data"
]

README badge

README badge for davila7/claude-code-templates/data-processing-nemo-curator