Quien busca un WiFi sensing dataset suele necesitar datos CSI públicos para actividad humana, un benchmark para comparar modelos o muestras realistas para probar una demo sin cámara. Esos objetivos se parecen, pero no piden el mismo dataset.
Para usuarios de RuView, el dataset importa porque está debajo de la interfaz. La demo muestra una experiencia, GitHub muestra el código y la guía ESP32 explica captura; el dataset define lo que el modelo pudo aprender.
Qué debe tener un buen dataset WiFi sensing
Un buen dataset WiFi sensing documenta cómo se capturó el CSI, no solo las clases disponibles. Debe indicar hardware, banda, antenas, ritmo de paquetes, sala, participantes, protocolo, sincronización y split de evaluación.
La tarea es el filtro principal. HAR necesita acciones repetidas; presencia necesita sala vacía y sala ocupada; respiración requiere referencia independiente; multiusuario necesita etiquetas que describan interacción y no solo acciones individuales.
- Prefiere datasets con hardware, sala, participantes y etiquetas explícitas.
- Busca baseline vacía y pruebas negativas, no solo clips correctos.
- Comprueba si el split separa personas, salas, sesiones o dispositivos.
Benchmarks públicos que conviene comparar
Los recursos públicos tienen formas distintas. Awesome-WiFi-CSI-Sensing funciona como directorio de papers, repositorios y datasets. SenseFi ayuda a comparar modelos PyTorch sobre datasets públicos. WiMANS es útil para actividad multiusuario. CSI-Bench apunta a pruebas reales con dispositivos WiFi comerciales.
No los trates como equivalentes. Un directorio sirve para descubrir, una biblioteca para reproducir y un dataset en campo para medir robustez.
| Recurso | Mejor uso | Qué revisar |
|---|---|---|
| Awesome-WiFi-CSI-Sensing | Encontrar papers y datasets | Acceso y documentación actual |
| SenseFi | Benchmark de modelos | Datasets, modelos y splits |
| WiMANS | Actividad multiusuario | Etiquetas, usuarios y video de referencia |
| CSI-Bench | WiFi sensing realista | Tareas, dispositivos y condiciones de acceso |
Cómo elegir datos para RuView
Empieza con la pregunta que quieres responder en RuView. Si buscas presencia, no empieces con gestos finos. Si buscas generalización, evita splits donde train y test vienen de la misma sesión.
La checklist práctica incluye CSI bruto, metadatos, etiquetas, baseline y splits. Sin esos elementos, la precisión puede ser memoria de una sala.
- Registra baseline local aunque uses datos públicos.
- Conserva tiempos y pruebas negativas para movimiento o pose.
- Documenta consentimiento y límites si hay video sincronizado.
Fallos frecuentes
El fallo más común es creer que una alta precisión en un dataset significa que el sistema funcionará en otra sala. El CSI cambia con paredes, muebles, antenas, firmware y tráfico.
También se mezclan tareas incompatibles. Un dataset de gestos no prueba presencia multiusuario, y un dataset con video puede ser demasiado sensible para una demo ligera.
| Fallo | Riesgo | Mejor enfoque |
|---|---|---|
| Usar una sola sala | El modelo memoriza multipath | Probar salas y sesiones distintas |
| Sin baseline | Aumentan falsos positivos | Capturar sala vacía y negativos |
| Ignorar privacidad | Video o rutinas son sensibles | Explicar consentimiento y acceso |
| Comparar tareas distintas | Las etiquetas no coinciden | Elegir dataset por tarea |
Plan pequeño con ESP32 y RuView
Si ningún dataset público coincide, crea uno pequeño: sala vacía, entrada, salida, caminar, sentarse, puerta sin persona y tráfico de router sin movimiento.
Guarda CSI bruto, features filtradas, etiquetas, notas de sala y splits por separado. Así cada predicción puede rastrearse hasta una sesión.
- Nombra sesiones por fecha, sala, dispositivo, banda y escenario.
- Separa CSI bruto de features procesadas.
- Reserva una sesión o sala para test.
Por qué no compite con otras páginas RuView
Esta guía no compite con la home, la guía GitHub, la guía ESP32 ni la página de motion capture. Su intención es elegir datasets, comparar benchmarks, revisar etiquetas y planificar validación.
Quien busca “ruview github” debe llegar a la guía GitHub. Quien busca “wifi sensing dataset” necesita criterios de datos antes de decidir si RuView, ESP32 o un corpus público es el siguiente paso.
Mapa de intención: dataset, benchmark, tutorial o captura local
La frase WiFi sensing dataset puede significar corpus CSI descargable, biblioteca benchmark, dataset tutorial para ESP32 o plan de validación para una demo RuView.
Antes de elegir datos, separa la intención. Para aprender, usa un benchmark documentado. Para validar un producto, captura un baseline local. Para HAR, exige etiquetas repetidas. Para presencia, prioriza sala vacía y falsos positivos.
| Intención | Mejor elección de datos | Evitar |
|---|---|---|
| Aprender el flujo | SenseFi o un benchmark CSI público documentado | Archivos zip sin documentar y sin división |
| Validar una sala | Dataset ESP32 local pequeño con líneas base | Usar solo datos públicos de otro edificio |
| Reconocimiento de actividad humana | Pruebas repetidas de actividades etiquetadas | Datasets solo de presencia |
| Revisar la demo RuView | Datos, límites, controles negativos y capturas separados | Tomar el éxito de la interfaz como prueba del modelo |
Dataset WiFi CSI o benchmark: elige según la tarea
Las búsquedas de un dataset CSI mezclan intención de descarga y comparación de benchmarks. Un dataset WiFi CSI contiene datos brutos o etiquetados; un benchmark de sensado WiFi añade una tarea, una división y un protocolo de evaluación definidos. Decide qué necesitas antes de comparar repositorios.
Para una prueba de sala estilo RuView, los datasets WiFi CSI públicos sirven como punto de partida, no como sustituto de la captura local. Ajusta hardware, etiquetas, sala y tarea a tu experimento y conserva una línea base de habitación vacía y una sesión separada.
- Usa un benchmark cuando necesites divisiones y comparaciones documentadas.
- Usa CSI local cuando cambien la sala o el hardware objetivo.
- Mantén trazables las etiquetas, muestras brutas, líneas base y divisiones.
Fuentes y referencias de datasets
Preguntas frecuentes sobre datasets WiFi sensing
¿Cuál es el mejor dataset para empezar?
Para aprender modelos, empieza con un benchmark bien documentado como SenseFi. Para una demo RuView real, añade una línea base local.
¿Puedo entrenar RuView con cualquier dataset CSI?
No con seguridad. Debe coincidir con hardware, tarea, sala y etiquetas.
¿Por qué importa la sala vacía?
Permite detectar cambios del entorno y falsos positivos.
¿Son sensibles estos datasets?
Sí. CSI puede revelar presencia y rutinas, y los videos sincronizados requieren más cuidado.
¿Debo usar un dataset público o capturar el mío?
Usa datos públicos para aprender el flujo y comparar métodos, pero captura tu baseline cuando el objetivo sea un resultado RuView en una sala concreta.
¿Cuál es la diferencia entre un dataset WiFi CSI y un benchmark?
Un dataset WiFi CSI es una colección de datos de canal brutos o etiquetados. Un benchmark añade tarea, división, métricas y protocolo de comparación. Para una prueba estilo RuView, los datos públicos enseñan el flujo, pero necesitas una línea base local.