GUÍA DE DATASETS WIFI

WiFi Sensing Dataset: cómo elegir datos CSI para RuView, HAR y presencia

Un buen dataset de WiFi sensing no es solo una carpeta de archivos CSI. Debe explicar hardware, etiquetas, línea base, límites de tarea y particiones de evaluación.

Infografía de datos WiFi que pasan de una habitación a etiquetas, línea base y validación
Un dataset útil conecta CSI bruto, contexto de habitación, etiquetas, línea base y particiones de validación.

Quien busca un WiFi sensing dataset suele necesitar datos CSI públicos para actividad humana, un benchmark para comparar modelos o muestras realistas para probar una demo sin cámara. Esos objetivos se parecen, pero no piden el mismo dataset.

Para usuarios de RuView, el dataset importa porque está debajo de la interfaz. La demo muestra una experiencia, GitHub muestra el código y la guía ESP32 explica captura; el dataset define lo que el modelo pudo aprender.

Qué debe tener un buen dataset WiFi sensing

Un buen dataset WiFi sensing documenta cómo se capturó el CSI, no solo las clases disponibles. Debe indicar hardware, banda, antenas, ritmo de paquetes, sala, participantes, protocolo, sincronización y split de evaluación.

La tarea es el filtro principal. HAR necesita acciones repetidas; presencia necesita sala vacía y sala ocupada; respiración requiere referencia independiente; multiusuario necesita etiquetas que describan interacción y no solo acciones individuales.

  • Prefiere datasets con hardware, sala, participantes y etiquetas explícitas.
  • Busca baseline vacía y pruebas negativas, no solo clips correctos.
  • Comprueba si el split separa personas, salas, sesiones o dispositivos.

Benchmarks públicos que conviene comparar

Los recursos públicos tienen formas distintas. Awesome-WiFi-CSI-Sensing funciona como directorio de papers, repositorios y datasets. SenseFi ayuda a comparar modelos PyTorch sobre datasets públicos. WiMANS es útil para actividad multiusuario. CSI-Bench apunta a pruebas reales con dispositivos WiFi comerciales.

No los trates como equivalentes. Un directorio sirve para descubrir, una biblioteca para reproducir y un dataset en campo para medir robustez.

Recurso Mejor uso Qué revisar
Awesome-WiFi-CSI-Sensing Encontrar papers y datasets Acceso y documentación actual
SenseFi Benchmark de modelos Datasets, modelos y splits
WiMANS Actividad multiusuario Etiquetas, usuarios y video de referencia
CSI-Bench WiFi sensing realista Tareas, dispositivos y condiciones de acceso

Cómo elegir datos para RuView

Empieza con la pregunta que quieres responder en RuView. Si buscas presencia, no empieces con gestos finos. Si buscas generalización, evita splits donde train y test vienen de la misma sesión.

La checklist práctica incluye CSI bruto, metadatos, etiquetas, baseline y splits. Sin esos elementos, la precisión puede ser memoria de una sala.

  • Registra baseline local aunque uses datos públicos.
  • Conserva tiempos y pruebas negativas para movimiento o pose.
  • Documenta consentimiento y límites si hay video sincronizado.

Fallos frecuentes

El fallo más común es creer que una alta precisión en un dataset significa que el sistema funcionará en otra sala. El CSI cambia con paredes, muebles, antenas, firmware y tráfico.

También se mezclan tareas incompatibles. Un dataset de gestos no prueba presencia multiusuario, y un dataset con video puede ser demasiado sensible para una demo ligera.

Fallo Riesgo Mejor enfoque
Usar una sola sala El modelo memoriza multipath Probar salas y sesiones distintas
Sin baseline Aumentan falsos positivos Capturar sala vacía y negativos
Ignorar privacidad Video o rutinas son sensibles Explicar consentimiento y acceso
Comparar tareas distintas Las etiquetas no coinciden Elegir dataset por tarea

Plan pequeño con ESP32 y RuView

Si ningún dataset público coincide, crea uno pequeño: sala vacía, entrada, salida, caminar, sentarse, puerta sin persona y tráfico de router sin movimiento.

Guarda CSI bruto, features filtradas, etiquetas, notas de sala y splits por separado. Así cada predicción puede rastrearse hasta una sesión.

  • Nombra sesiones por fecha, sala, dispositivo, banda y escenario.
  • Separa CSI bruto de features procesadas.
  • Reserva una sesión o sala para test.
Diagrama editorial para validar capturas de datasets de sensado WiFi con distintos dispositivos
Añade una validación de dispositivos cuando el dataset público no coincide con la sala o el hardware objetivo.

Por qué no compite con otras páginas RuView

Esta guía no compite con la home, la guía GitHub, la guía ESP32 ni la página de motion capture. Su intención es elegir datasets, comparar benchmarks, revisar etiquetas y planificar validación.

Quien busca “ruview github” debe llegar a la guía GitHub. Quien busca “wifi sensing dataset” necesita criterios de datos antes de decidir si RuView, ESP32 o un corpus público es el siguiente paso.

Mapa de intención: dataset, benchmark, tutorial o captura local

La frase WiFi sensing dataset puede significar corpus CSI descargable, biblioteca benchmark, dataset tutorial para ESP32 o plan de validación para una demo RuView.

Antes de elegir datos, separa la intención. Para aprender, usa un benchmark documentado. Para validar un producto, captura un baseline local. Para HAR, exige etiquetas repetidas. Para presencia, prioriza sala vacía y falsos positivos.

Intención Mejor elección de datos Evitar
Aprender el flujo SenseFi o un benchmark CSI público documentado Archivos zip sin documentar y sin división
Validar una sala Dataset ESP32 local pequeño con líneas base Usar solo datos públicos de otro edificio
Reconocimiento de actividad humana Pruebas repetidas de actividades etiquetadas Datasets solo de presencia
Revisar la demo RuView Datos, límites, controles negativos y capturas separados Tomar el éxito de la interfaz como prueba del modelo

Dataset WiFi CSI o benchmark: elige según la tarea

Las búsquedas de un dataset CSI mezclan intención de descarga y comparación de benchmarks. Un dataset WiFi CSI contiene datos brutos o etiquetados; un benchmark de sensado WiFi añade una tarea, una división y un protocolo de evaluación definidos. Decide qué necesitas antes de comparar repositorios.

Para una prueba de sala estilo RuView, los datasets WiFi CSI públicos sirven como punto de partida, no como sustituto de la captura local. Ajusta hardware, etiquetas, sala y tarea a tu experimento y conserva una línea base de habitación vacía y una sesión separada.

  • Usa un benchmark cuando necesites divisiones y comparaciones documentadas.
  • Usa CSI local cuando cambien la sala o el hardware objetivo.
  • Mantén trazables las etiquetas, muestras brutas, líneas base y divisiones.

Fuentes y referencias de datasets

Preguntas frecuentes sobre datasets WiFi sensing

¿Cuál es el mejor dataset para empezar?

Para aprender modelos, empieza con un benchmark bien documentado como SenseFi. Para una demo RuView real, añade una línea base local.

¿Puedo entrenar RuView con cualquier dataset CSI?

No con seguridad. Debe coincidir con hardware, tarea, sala y etiquetas.

¿Por qué importa la sala vacía?

Permite detectar cambios del entorno y falsos positivos.

¿Son sensibles estos datasets?

Sí. CSI puede revelar presencia y rutinas, y los videos sincronizados requieren más cuidado.

¿Debo usar un dataset público o capturar el mío?

Usa datos públicos para aprender el flujo y comparar métodos, pero captura tu baseline cuando el objetivo sea un resultado RuView en una sala concreta.

¿Cuál es la diferencia entre un dataset WiFi CSI y un benchmark?

Un dataset WiFi CSI es una colección de datos de canal brutos o etiquetados. Un benchmark añade tarea, división, métricas y protocolo de comparación. Para una prueba estilo RuView, los datos públicos enseñan el flujo, pero necesitas una línea base local.