Grouping near-duplicate content across sources by meaning rather than exact text match.
Embedding similarity feeding a classic clustering algorithm to group near-duplicates.
Same embeddings as CAP-102; scikit-learn or similar for clustering