🏠 होम
बेंचमार्क
📊 सभी बेंचमार्क 🦖 डायनासोर v1 🦖 डायनासोर v2 ✅ टू-डू लिस्ट ऐप्स 🎨 रचनात्मक फ्री पेज 🎯 FSACB - अल्टीमेट शोकेस 🌍 अनुवाद बेंचमार्क
मॉडल
🏆 टॉप 10 मॉडल 🆓 मुफ्त मॉडल 📋 सभी मॉडल ⚙️ किलो कोड
संसाधन
💬 प्रॉम्प्ट लाइब्रेरी 📖 एआई शब्दावली 🔗 उपयोगी लिंक
advanced

Стратегия очистки сложных данных

#data-science #python #pandas #cleaning #statistics

Разработайте комплексный план обработки данных с выбросами, пропусками и структурными ошибками.

Вам предоставлен набор данных (описание структуры, но не сами данные: 50% числовых, 30% категориальных, 20% временных меток) о транзакциях электронной коммерции. Данные характеризуются: 1. 25% пропусков в категориальных переменных (не случайных). 2. Выбросы в числовых переменных, которые могут быть как ошибками ввода, так и реальными транзакциями VIP-клиентов. 3. Несоответствие форматов дат (микс ISO и POSIX). Напишите подробный алгоритм и псевдокод на Python (используя Pandas/NumPy) для автоматизированной очистки. Объясните, как вы будете дифференцировать ошибки от редких событий и какие методы импутации выберете для каждого типа данных.