NeuroLens
Memoria aumentada para profesionales. Un módulo Linux acoplable que convierte cualquier lente convencional en un dispositivo inteligente — con captura, transcripción, indexación y recuperación de recuerdos 100% locales. Nada sale del perímetro del cliente.
00Resumen ejecutivo
El mercado de smart glasses explotó — y dejó un hueco exacto con la forma de este producto.
Meta vendió 7 millones de lentes inteligentes en 2025 (82% de cuota global) y planea capacidad para 10–30 M/año. El segmento creció +139% interanual en H2 2025 y las proyecciones de IDC dan CAGR de 18.9–41.9% hasta 2030. Pero toda esa ola comparte tres decisiones de diseño que excluyen a un comprador entero: la IA vive en la nube, la memoria es del fabricante y los lentes son del fabricante.
El hueco 1 · Retrofit
Nadie comercial hace un módulo acoplable con IA. Lo que existe: CAMIO ($79, solo cámara, sin IA), JLab Frames (solo audio, legado) y OpenGlass (DIY ~$25, depende de nube). El espacio "clip con IA y memoria" está vacío.
El hueco 2 · Local-first
Los wearables de memoria fueron absorbidos por hyperscalers: Limitless→Meta (dic-2025), Bee→Amazon (2025). Todos son 100% nube. Humane murió y sus dispositivos quedaron inservibles en 10 días. Nadie vende memoria persistente que viva en el dispositivo del cliente.
El hueco 3 · Precio enterprise
El hardware industrial cuesta $2,000–3,700 (Vuzix M400, RealWear Navigator, Iristick) y su SaaS se vende solo por cotización. Entre el consumer de $299 y el enterprise de $2,900 hay un hueco de precio de 4–10×.
NeuroLens ataca los tres huecos a la vez: un clip de ~20 g que se monta en la patilla de cualquier armazón, un hub de bolsillo que corre ASR + RAG + LLM sin internet, y un servidor on-premise para flotas. El cliente objetivo inicial no es el consumidor — es el técnico de campo y el ingeniero de sitio en telecom, data centers y manufactura de LATAM, donde la evidencia de trabajo manos libres tiene ROI documentado (DHL: +15% productividad en picking; Honeywell: −50% costos de viaje con RealWear) y donde las políticas de datos prohíben exactamente lo que Meta, Amazon y Google necesitan para operar: que el audio del cliente salga del sitio.
Este documento contiene la ingeniería a nivel de componente (números de parte y precios verificados a agosto 2026) para construir el prototipo v0 con ~$126 USD (usando la laptop actual como estación base; ~$226 con el hub de bolsillo incluido), la ruta a producto certificado, y el plan de negocio a 10 años. Las afirmaciones no verificadas están marcadas [EST] y consolidadas en el Anexo A1.
01Arquitectura de hardware
Decisión rectora: física antes que deseos. La térmica de la sien manda.
El error de todos los smart glasses integrados es meter el cómputo donde no cabe el calor. Un cuerpo en contacto con la piel de la cara no debe pasar de 41–43 °C (el estándar de la industria usa ~48 °C como techo absoluto y 41–42 °C como confort sostenido). Con ~30 cm² de superficie disipando por convección natural, el presupuesto continuo en la patilla es de 0.3–0.55 W [EST — cálculo de ingeniería: h≈10–15 W/m²K, ΔT≈8–12 K]. Por eso Meta limita el video a ráfagas y regula funciones por temperatura. Conclusión: el LLM nunca va en los lentes. NeuroLens es una arquitectura dividida en tres niveles:
NIVEL 1 · CLIP (en la patilla, ~20 g)
- Captura: 2× mic MEMS + cámara 3 MP
- SoC Linux RV1106 (ISP + NPU 1 TOPS)
- VAD, wake, detección de eventos
- Opus 24 kbps + buffer local cifrado
- Presupuesto: ≤0.5 W sostenido
NIVEL 2 · HUB (bolsillo, ~120 g)
- ASR completo (whisper.cpp / NeMo es)
- Embeddings + índice vectorial
- LLM 0.5–1.7B en NPU (AX630C, 1.5 W)
- Memoria del día completa, cifrada
- Respuestas por audio al clip
NIVEL 3 · NIDO (escritorio / on-prem)
- RAG completo, LLM 4–8B, VLM, OCR
- Base de conocimiento histórica
- Multi-usuario (versión enterprise)
- Nunca expuesto a internet
Por qué esta división es correcta (y no un parche)
- Térmica — el clip solo hace captura y filtrado: RV1106 en carga parcial ≈ 0.3–0.5 W, dentro del presupuesto de la sien. El hub, en el bolsillo, tolera 1.5–3 W sin tocar piel sensible.
- Batería — la celda grande (103450, 1,800–2,000 mAh, ~35 g) vive en el hub, no en la cabeza. El clip lleva una 502030 de 250 mAh y 5 g: suficiente para una jornada si el micrófono despierta al SoC solo cuando hay voz (el TDK T5848 con Acoustic Activity Detection consume ~20 µA en silencio — el mismo truco que usa el wearable Omi).
- Radio — Opus a 24 kbps son 3 kB/s; el peor caso real de BLE (~12 kB/s en iPhone sin optimizar) lo carga cuatro veces. No hay cuello de botella de transporte.
- Legal — separar captura (clip) de retención (hub/nido) permite políticas por nivel: el clip puede operar en modo "sin retención" en zonas restringidas (ver §16).
- Comercial — el clip es barato de reponer y frame-agnostic; el hub es donde vive el margen y la memoria del usuario. Si el usuario cambia de lentes, no pierde nada.
Presupuesto de energía (jornada de 10 h)
| Elemento | Estado dominante | Potencia | Energía/10 h | Celda | Autonomía |
|---|---|---|---|---|---|
| Clip — escucha pasiva (AAD, SoC dormido) | ~85% del tiempo | ~15 mW [EST] | ~0.13 Wh | LP502030 250 mAh = 0.93 Wh | ~10–12 h [EST] |
| Clip — captura activa (VAD+Opus+radio) | ~15% del tiempo (≈90 min de voz) | ~0.45 W | ~0.68 Wh | ||
| Hub — ASR + indexado por ráfagas | procesa el backlog en lotes | 0.5 W reposo / 1.5 W pico (AX630C) | ~7 Wh | 103450 2,000 mAh = 7.4 Wh | ~10 h, o ilimitado con powerbank |
Consumos base medidos por fuentes citadas: AX630C 0.5 W idle / 1.5 W plena carga (M5Stack); Pi Zero 2 W 0.38–3.1 W (CNX Software); AAD ~20 µA (arquitectura Omi/nRF5340). El reparto 85/15 es supuesto de diseño [EST] — validar en el piloto.
Variantes de despliegue
| Variante | Clip | Hub | Nido | Cliente |
|---|---|---|---|---|
| v0 — prototipo | Luckfox Pico Ultra + SC3336 + mic I2S en montura impresa | La laptop del desarrollador (ya corre Ollama/whisper) | La misma laptop | Nosotros mismos |
| v1 — piloto | PCB propia (§03) | M5Stack LLM630 ($99.90) en carcasa impresa | Mini-PC o servidor del cliente | 10 técnicos de campo |
| v2 — producto | PCB rev B + molde | PCB propia con AX630C o sucesor | NeuroLens Server (software, hardware del cliente) | Flotas enterprise |
02Sistema operativo Linux
Dos Linux distintos porque son dos problemas distintos.
Clip: Buildroot
El RV1106 corre el BSP de Rockchip sobre Buildroot. No hay systemd, no hay apt, no hay usuarios interactivos: un rootfs de ~40 MB, de solo lectura, con exactamente los procesos del pipeline de captura. Arranque <3 s. Es la elección correcta porque el clip es un electrodoméstico: firmware, no computadora.
- Rootfs inmutable — squashfs de solo lectura + partición de datos cifrada (dm-crypt) para el buffer de audio. Un clip robado no entrega nada sin la llave, que vive en el hub.
- Actualización A/B — dos slots de firmware con RAUC; el bootloader revierte solo si el slot nuevo no marca arranque exitoso. Nunca un clip brickeado en campo.
- Watchdog de hardware habilitado desde U-Boot: el pipeline de captura se reinicia solo.
Hub y Nido: Debian → Yocto
Para v0/v1 el hub corre el Linux del fabricante (Ubuntu/Debian en el LLM630 o Armbian en Radxa) — velocidad de desarrollo primero. Para v2, Yocto con la misma disciplina del clip (imagen mínima, A/B, firmado). El Nido enterprise se entrega como OCI containers sobre el Linux que el cliente ya opera (RHEL incluido — es exactamente el mundo del que venimos), con SELinux enforcing y sin dependencia de internet ni siquiera para licenciamiento.
Cadena de confianza
BootROM RV1106 → verifica firma → U-Boot (llave de InGrid, fusible OTP) → verifica → kernel + squashfs (dm-verity) → monta → datos (dm-crypt, llave sellada en el pareo clip↔hub) Actualización: RAUC bundle firmado → slot B → reboot → confirmación o rollback
03Diseño electrónico
v0 con módulos comprables hoy; v1 con PCB propia de 4 capas.
v0 — BOM del prototipo (todo verificado, agosto 2026)
| Bloque | Parte | Precio | Notas |
|---|---|---|---|
| SoC clip | Luckfox Pico Ultra (RV1106G3) | $26.99 | A7 1.2 GHz + NPU 1 TOPS + ISP 4 MP integrado; corre Buildroot. La alternativa con WiFi6: Sipeed LicheeRV Nano W (SG2002), $23.90 |
| Cámara | Waveshare SC3336 3 MP (B) | $8.99 | 1/2.8", F2.0, FOV 98.3°, buen SNR nocturno; FFC directo al Luckfox |
| Micrófonos | 2× ICS-43434 (breakout Adafruit 6049) | $17.90 | I2S digital, SNR 65 dBA, 490 µA; sucesor del INMP441. En v1: TDK T5848 con AAD para wake-on-sound |
| Audio out | MAX98357A (Adafruit 3006) + transductor óseo (Adafruit 1674) | $14.90 | Amp I2S 1.2 g + conducción ósea: respuesta audible sin taparle el oído al técnico |
| Batería clip | LiPo LP502030 250 mAh c/PCM | ~$9 | La misma celda que usa OpenGlass; 5 g, con protección integrada obligatoria |
| Carga | BQ24074 (Adafruit 4755) + MAX17048 (Adafruit 5580) | $20.90 | Power-path real (opera mientras carga — el TP4056 no sirve para esto) + fuel gauge I2C |
| Hub | M5Stack LLM630 Compute Kit (AX630C) | $99.90 | NPU 3.2 TOPS INT8, 4 GB, WiFi6; corre Qwen 0.5–1.5B y whisper en NPU a 1.5 W máx — el mejor rendimiento/watt verificado de su clase |
| Almacenamiento | microSD high endurance 64 GB | ~$12 | v2 pasa a eMMC industrial para el rootfs |
| Misceláneos | FFC, JST-PH, USB-C breakout, filamento | ~$15 | — |
| Total v0 | ≈ $226 | ≈ $126 si el hub v0 es la laptop y el LLM630 se difiere a M1 | |
v1 — PCB propia del clip
Una placa de 4 capas, 55 × 16 mm, componentes en ambas caras:
- Cerebro: RV1106G3 (SiP con DDR3L 256 MB integrada — sin ruteo de DDR, el ahorro de ingeniería más grande de todo el diseño).
- Audio: 2× TDK T5848 en configuración end-fire separados 21 mm para beamforming hacia la boca del interlocutor; el modo AAD del propio micrófono despierta al SoC vía GPIO.
- Potencia: BQ24074 + MAX17048 + reguladores buck de alta eficiencia; dominio "always-on" de ~20 µA (mic AAD + RTC) separado del dominio del SoC.
- El LED de grabación va en serie con el riel de la cámara y el bias de los micrófonos. No es un GPIO: si hay corriente de captura, hay luz. Físicamente imposible grabar con el LED apagado — la respuesta de diseño a la crisis 2026 de Meta (LED tapado/deshabilitado) y un artefacto de cumplimiento que se enseña en la venta enterprise (§16, §20).
- Conector: USB-C (carga + consola + fastboot para flasheo); pogo-pins magnéticos al dock en v2.
- EMC: plano de tierra continuo, antena WiFi cerámica en esquina con keep-out, ferritas en el riel de cámara. Pre-scan EMC antes de certificar (§18).
04Diseño mecánico imprimible en 3D
El clip debe sobrevivir a tres armazones distintos y a un turno de 10 horas.
Geometría
Las patillas de lentes comerciales varían entre ~8 y 18 mm de alto y 2–6 mm de espesor cerca de la bisagra [EST — medir la muestra real del piloto]. El clip no puede asumir una: el diseño usa una mordaza de dos piezas: shell rígido (PETG o PA12) con la electrónica, y una garra interior de TPU 95A intercambiable en tres tallas (S/M/L) que abraza la patilla sin rayarla. La garra es la pieza que se regala en tres tamaños con cada unidad — cuesta centavos y elimina el problema de compatibilidad.
Distribución de masa
| Pieza | Masa objetivo | Posición |
|---|---|---|
| PCB + SoC + cámara + mics | ~7 g | Delante, cámara alineada a la mirada |
| Batería 502030 + PCM | ~5 g | Atrás de la oreja — contrapeso natural, y la celda queda lejos de la sien (regla de seguridad LiPo: nunca en contacto directo con la piel; carcasa intermedia siempre) |
| Shell + garra TPU + FFC | ~8 g | Distribuido |
| Total clip | ~20 g | Referencias: unos lentes normales pesan 25–35 g; los Ray-Ban Meta Display, 69 g |
Reglas de impresión y ruta a molde
- Shell en PETG (0.16 mm, 4 perímetros, 40% giroide) o PA12 por SLS para el piloto; TPU 95A a 0.2 mm para garras. PLA solo para prototipos de forma — se deforma en un tablero de auto en verano.
- Tolerancias FDM: holguras de 0.25 mm en encajes, 0.45 mm en piezas móviles; insertos roscados M1.6 por calor para el acceso a batería.
- Canal acústico de los mics: puertos de Ø1 mm con malla hidrofóbica adhesiva (la misma solución de los teléfonos) — objetivo IP52 en v1, IP54 con junta de TPU en v2.
- La celda LiPo con 10% de holgura mecánica (hinchazón), sin tornillos que la atraviesen, y corte de carga por temperatura >45 °C en el BQ24074.
- Ruta a producción: los mismos STEP pasan a molde de inyección (~$8–15 k por cavidad [EST]) solo después de que el piloto congele la geometría. Hasta 500 unidades, SLS/MJF es más barato que el molde.
05Procesamiento de audio
El audio es el producto. El video es el complemento. Esta prioridad está en los datos.
Plaud — audio puro, sin cámara, sin display — superó $100 M de ARR con ~50% de conversión a pago. Ninguna empresa de smart glasses con cámara ha publicado un número de software comparable. La memoria profesional útil es sobre todo lo que se dijo: compromisos, cifras, nombres, instrucciones. NeuroLens invierte el 70% de su esfuerzo de inteligencia en la cadena de audio.
La cadena, etapa por etapa
CLIP · SIEMPRE
- T5848 AAD (~20 µA)
- despierta SoC solo con actividad acústica
CLIP · CON VOZ
- Silero VAD (~2 MB, <1 ms/chunk)
- beamforming 2 mics
- Opus 24 kbps VBR
- ring buffer cifrado
HUB · POR LOTES
- ASR español (abajo)
- diarización por sesión
- puntuación + timestamps por palabra
HUB · ÍNDICE
- SQLite FTS5
- embeddings (§09)
- momentos (§07)
Elección de ASR para español (con números medidos)
| Motor | Modelo | RTF / velocidad | RAM | Veredicto |
|---|---|---|---|---|
| whisper.cpp | base multilingüe | RTF 0.16 (RK3588, 8 hilos) | 410 MB | El caballo de batalla del hub — 1 h de audio se procesa en ~10 min |
| whisper.cpp | small multilingüe | RTF 0.47 (RK3588) | 889 MB | Pasada nocturna de re-transcripción de alta calidad en el Nido |
| sherpa-onnx | NeMo fast-conformer CTC (incluye es) | streaming real | <500 MB [EST] | Modo en vivo: comandos de voz y consulta hablada |
| Vosk | small-es 0.42 (39 MB) | streaming, corre hasta en Pi Zero 2 W | ~300 MB | Plan B mínimo y wake-phrase de respaldo; WER 11–16% |
| Moonshine v2 | tiny/small (español desde ago-2026, alpha) | 5–15× más rápido que Whisper (claim) | 26 MB modelo | Apuesta a 12 meses: si el español madura, ASR en el propio clip |
RTF medidos por Turing Pi (RK3588); Vosk WER de alphacephei; Moonshine de sus papers y del paquete moonshine-voice 0.1.5 (24-ago-2026). RTF en el AX630C del hub: sin benchmark público — medir en v0 [EST]; el M5Stack lista whisper-tiny/base corriendo en su NPU.
Diarización sin voiceprints — decisión legal de diseño
Separar "quién habló" es indispensable; almacenar huellas de voz es un pasivo legal (BIPA define voiceprint como biométrico: $1,000–5,000 por violación; en nov-2025 se certificó una clase de 1.2 M usuarios contra Amazon por Voice ID). La solución: diarización efímera por sesión — los embeddings de hablante (sherpa-onnx, pyannote-segmentation ONNX) viven solo en RAM durante la reunión, etiquetan Speaker A/B/C, y se destruyen. La transcripción conserva las etiquetas; el usuario puede renombrarlas a mano ("A = Emilia"). Nunca se persiste un vector de voz, nunca se re-identifica entre sesiones. Menos mágico, y vendible en Illinois.
Salida: conducción ósea
Las respuestas del asistente llegan por transductor óseo (1 W), no por bocina ni auricular: el técnico mantiene los oídos libres (requisito de seguridad industrial real) y el audio no se difunde a terceros. Latencia objetivo de consulta hablada completa: <4 s (§10).
06Procesamiento de video
Cámara de evidencia, no videocámara. Fotogramas con propósito.
Grabar video continuo es la decisión incorrecta tres veces: térmicamente (es lo que sobrecalienta a los Ray-Ban), legalmente (§16) y en almacenamiento. Rewind ya demostró el patrón correcto en desktop: capturas espaciadas + dedupe + OCR asíncrono. NeuroLens lo traslada al mundo físico:
- Captura por eventos, no por reloj: el clip toma un fotograma 3 MP cuando (a) el usuario lo pide ("NeuroLens, captura"), (b) arranca un momento nuevo (§07), (c) el NPU detecta un objeto de interés declarado — un rack, una etiqueta de activo, un tablero — con YOLOv8n int8 sobre el NPU del RV1106 (~10 FPS disponibles de sobra para decidir [EST — 18.2 FPS medidos en la clase RK3566; el RV1106 es menor]), o (d) botón físico.
- Dedupe perceptual (dHash) antes de gastar radio: si el frame es 95% igual al anterior, no viaja.
- OCR en el Nido — RapidOCR/PaddleOCR para etiquetas, seriales, pantallas y pizarras (PaddleOCR: 0 errores en el benchmark de facturas vs 3 de Tesseract; Tesseract queda como fallback ligero). Cada texto extraído entra al índice FTS con su timestamp y su frame.
- VLM para descripción de escena — Moondream 0.5B (816 MB RAM) o LFM2.5-VL-450M (multilingüe, español incluido) en el Nido: convierte el fotograma en una frase indexable ("gabinete abierto, panel de fibra, puerto 12 desconectado").
- Nada de reconocimiento facial. Nunca. No es una limitación técnica sino una línea de producto: es la frontera entre "memoria del profesional" y "vigilancia de terceros" (§16). El VLM describe escenas, no identifica personas.
Aritmética de almacenamiento (jornada de 10 h)
| Flujo | Tasa | Por jornada | Por mes (22 días) |
|---|---|---|---|
| Audio Opus 24 kbps (solo voz, ~3 h efectivas) | 10.8 MB/h | ~32 MB | ~0.7 GB |
| Fotogramas 3 MP JPEG (~50/día × 350 KB) | — | ~18 MB | ~0.4 GB |
| Transcripciones + índices + embeddings | — | ~5 MB | ~0.1 GB |
| Total | ~55 MB/día | ~1.2 GB/mes — 5 años de vida profesional caben en 128 GB |
Referencia: Rewind lograba ~5 GB/mes grabando la pantalla completa de una Mac; capturando solo voz y eventos, NeuroLens queda un orden de magnitud abajo.
07Detección contextual
La memoria sin contexto es una cinta. Con contexto, es un archivo consultable.
La unidad de la memoria de NeuroLens no es el archivo ni el minuto: es el momento — un segmento con inicio, fin, lugar, participantes y tema. Todo el retrieval (§10) opera sobre momentos. El segmentador corre en el hub y corta cuando cambia el contexto, usando señales baratas:
| Señal | Fuente | Costo | Qué aporta |
|---|---|---|---|
| Huella de radio | BSSIDs WiFi visibles + beacons BLE (escaneo pasivo, sin conectarse) | casi nulo | "Sitio" sin GPS: la sala de servidores, la oficina del cliente, el pasillo. Se guarda un hash de la huella, no la ubicación absoluta — no hay historial de ubicación exportable (§16) |
| Actividad de voz | VAD + diarización de sesión | ya se paga en §05 | Detecta inicio/fin de conversaciones y cambio de interlocutores |
| Escena visual | Clasificador ligero en NPU del clip (interior/exterior/rack/oficina/vehículo) | ~1 frame/min | Confirma el cambio de sitio; dispara captura de §06 |
| Reloj + calendario | ICS del teléfono/PC (opcional, local) | nulo | Ancla momentos a citas con nombre ("ventana CHG…", "junta con auditoría") |
| Marcas del usuario | Botón / "NeuroLens, marca esto" | nulo | La señal más valiosa: el usuario declara importancia en el instante |
El resultado por momento: {t_ini, t_fin, sitio_hash, n_hablantes, escena, titulo_generado,
resumen_llm, importancia}. El título y el resumen los escribe el LLM del hub al cerrar el momento
("Revisión de respaldos con equipo de monitoreo, 2 participantes, 22 min"). Un turno de 10 h produce
típicamente 15–40 momentos [EST] — la escala a la que un humano de verdad recuerda su día.
08Base de conocimiento persistente
SQLite como columna vertebral. Aburrido a propósito: la memoria de una persona no puede depender de un servicio de moda.
El teardown de Rewind y su clon open source retrace convergen en la misma lección: el motor de una memoria personal es SQLite con FTS, con la búsqueda semántica como capa adicional — no al revés. NeuroLens adopta ese patrón endurecido:
momento(id, t_ini, t_fin, sitio_hash, escena, titulo, resumen, importancia) transcripcion(momento_id, hablante, t_palabra, palabra) -- timestamps por palabra frame(id, momento_id, t, ruta_jpeg, dhash, descripcion_vlm) ocr(frame_id, texto, bbox) -- texto en imágenes entidad(id, tipo, nombre, alias) -- persona/equipo/sitio/ticket mencion(entidad_id, momento_id, t, confianza) -- grafo ligero por tabla puente compromiso(id, momento_id, texto, quien, para_cuando, estado) -- extraído por el LLM (§09) + FTS5 sobre transcripcion/ocr/resumen (tokenizer unicode61, stemming es) + vec: embeddings por chunk (sqlite-vec) → §11
- Cifrado en reposo: partición dm-crypt/LUKS2; la llave deriva del pareo físico clip↔hub más el PIN del usuario. En el Nido enterprise, llave por usuario — el administrador de la flota no puede leer la memoria de un técnico sin un proceso de dos personas (§14: esto es una feature vendible, no una limitación).
- Retención por política: TTL por defecto configurable por el cliente (p. ej. audio crudo 30
días, transcripciones 2 años, compromisos indefinido). La nueva LFPDPPP mexicana (2025) exige plazos de
conservación y supresión formales — aquí son un
UPDATEde una tabla de políticas, no un proyecto. - Borrado real: "olvida los últimos 10 minutos" y "olvida este momento" ejecutan DELETE + VACUUM incremental + purga del Opus asociado, y quedan asentados en una bitácora de auditoría (qué se borró y cuándo, no el contenido).
- Exportación: todo el archivo del usuario sale a un ZIP (SQLite + Opus + JPEG) con un comando. La anti-Humane: si InGrid desaparece mañana, el dispositivo y la memoria siguen funcionando y el dato sigue siendo del usuario. Esa garantía va impresa en el contrato (§20).
09Motor semántico
Del texto plano a significado consultable, con modelos que caben en un bolsillo.
Embeddings
EmbeddingGemma (Google, sep-2025) es la elección clara para español: 308 M parámetros, 100+ idiomas, <200 MB cuantizado, y dimensiones Matryoshka — se generan 768d y se almacenan 256d, que conservan casi toda la calidad de retrieval con un tercio del espacio y del tiempo de búsqueda. Era el #1 de MTEB multilingüe bajo 500 M al lanzarse. Fallback si el hub va corto de RAM: arctic-embed-xs / MiniLM 384d, pero son solo-inglés — para nuestro mercado, EmbeddingGemma no tiene rival de su tamaño. Velocidad exacta en el AX630C: por medir en v0 [EST]; el embedding corre por lotes al cerrar cada momento, así que no está en ninguna ruta de latencia crítica.
Extracción estructurada
Al cerrar cada momento, el LLM del hub (Qwen3 1.7B Q4; §12) hace tres pasadas baratas con salida JSON forzada por gramática GBNF (cero alucinación de formato):
- Resumen y título del momento (2 frases máx).
- Entidades: personas mencionadas (por nombre dicho, no por voz), equipos ("el servidor .82",
"OSSDBC"), tickets ("REQ0366345"), sitios. Normalizadas contra la tabla
entidadcon alias — el mismo problema de "HOSNAME vs HOSTNAME" que ya conocemos de Tellus: el alias manda, no la ortografía. - Compromisos: "yo mando el correo mañana", "Emilia sube la evidencia el viernes" →
compromiso(quien, texto, para_cuando). Esta tabla es la killer feature del producto para un profesional de servicios: la lista de promesas hechas y recibidas, con el audio original a un clic.
Grafo ligero, no grafo religioso
Nada de Neo4j embebido: la tabla mencion (entidad ↔ momento) es el grafo.
"¿Cuándo fue la última vez que hablé con X del servidor Y?" es un JOIN de tres tablas con índices —
milisegundos en SQLite. La regla de diseño: cada capa semántica debe poder reconstruirse desde las
transcripciones crudas; si un modelo mejor aparece en 2027, se re-procesa el archivo entero
offline y la memoria mejora retroactivamente. Los datos crudos son sagrados; las capas derivadas son
reemplazables.
10Recuperación de recuerdos
Tres modos de acceso, tres presupuestos de latencia.
Modo 1 — Consulta hablada (<4 s)
0–0.3 s
- wake + ASR streaming de la pregunta (sherpa-onnx)
0.3–1 s
- búsqueda híbrida (§11): FTS5 + vectores + filtro temporal
- top-12 chunks
1–3.5 s
- Qwen3 1.7B sintetiza respuesta de 1–2 frases con cita de momento
3.5–4 s
- TTS (Piper es) → conducción ósea
"¿Qué número de cambio me dio Morales?" → «CHG0106900, te lo dio ayer a las 4:12 de la tarde en la llamada con el CTE». La cita temporal siempre acompaña la respuesta: la confianza en una memoria protésica se construye pudiendo verificar de dónde salió cada dato.
Modo 2 — Línea de tiempo (app/escritorio)
La interfaz visual contra el Nido: el día como lista de momentos con título, sitio y participantes;
búsqueda instantánea (FTS5 responde <100 ms como en retrace); clic en cualquier palabra de una
transcripción reproduce el audio desde ese timestamp. La tabla compromiso se proyecta como
lista de pendientes con enlace al momento de origen.
Modo 3 — Recuerdo proactivo (apagado por defecto)
Cuando el contexto actual coincide con memoria relevante — la huella de radio dice "sala de servidores de Mérida" y hay un compromiso abierto anclado a ese sitio — el hub susurra una línea: «Aquí quedaste pendiente de verificar el respaldo del .39». Reglas duras: máximo N por día, jamás en conversación activa (el VAD lo sabe), y opt-in explícito. Un asistente que interrumpe es un producto devuelto.
11Sistema RAG local
Recuperación híbrida sobre ferretería mínima — y honesta sobre sus límites.
Pipeline de indexado
- Chunking por momento: ventanas de ~300 tokens con solape de 60, sin cruzar fronteras de momento (un chunk jamás mezcla dos reuniones). Cada chunk hereda metadatos: momento, sitio, hablantes, fecha.
- Embedding EmbeddingGemma 256d, por lotes al cerrar el momento.
- Almacenamiento:
sqlite-vec(proyecto activo: v0.1.9 mar-2026) en la misma base que todo lo demás — una sola transacción, un solo backup, cero servicios extra.
Recuperación híbrida
candidatos = FTS5(query_normalizada, top=40) -- exacto: seriales, tickets, nombres
∪ vec_search(embed(query), top=40) -- semántico: "lo del disco lleno"
∪ filtro_temporal("ayer", "la semana pasada")
score = RRF(rank_fts, rank_vec) × frescura(λ decae 90 días) × importancia_momento
→ top-12 al LLM con sus metadatos → respuesta con citas [momento#id]
La fusión RRF (reciprocal rank fusion) evita calibrar pesos entre dos escalas incomparables. El sesgo de frescura refleja cómo funciona la memoria profesional: lo de esta semana pesa más, pero un "¿qué acordamos en marzo?" con filtro temporal explícito anula el decaimiento.
Los números que hacen esto viable — y el techo
| Escala | Corpus | Estrategia | Latencia búsqueda |
|---|---|---|---|
| 1 año de uso | ~80 k chunks [EST] | sqlite-vec fuerza bruta + int8 | <70 ms (medido: 100k×384d full-scan = 68 ms; int8 optimizado = 17 ms) |
| 5 años / heavy user | ~500 k chunks | sqlite-vec + pre-filtro por rango de fechas antes del scan | <150 ms [EST] |
| Flota enterprise (Nido) | millones | LanceDB con índice IVF-PQ en disco — HNSW en RAM (Chroma/hnswlib) queda descartado: 1 M×384d ≈ 1.5 GB de RAM solo de índice | <100 ms |
Evaluación continua
Un RAG sin arnés de evaluación degenera en demos. Desde v0: un set de ~200 preguntas doradas sobre un corpus de prueba propio (jornadas grabadas con consentimiento del equipo), métricas recall@12 y "respuesta correcta con cita correcta", corridas en CI en cada cambio de chunking, modelo o prompt. El arnés es también el argumento de venta técnica: publicamos las métricas, los incumbentes no.
12IA offline
Cada modelo tiene un asiento asignado. Nada asume internet, jamás.
| Tarea | Modelo | Tamaño | Dónde corre | Rendimiento verificado |
|---|---|---|---|---|
| Actividad acústica | T5848 AAD (hardware) | 0 | Clip (mic) | ~20 µA |
| VAD | Silero VAD v6 | 2 MB | Clip | <1 ms/chunk (x86; ARM por medir) |
| Detección visual | YOLOv8n int8 RKNN | ~4 MB | Clip (NPU 1 TOPS) | 18 FPS en clase RK3566; RV1106 menor [EST] |
| ASR lote | whisper.cpp base multilingüe | ~150 MB | Hub | RTF 0.16 en RK3588; AX630C por medir |
| ASR streaming | sherpa-onnx NeMo fast-conformer es | ~460 MB | Hub | streaming nativo |
| Embeddings | EmbeddingGemma @256d | <200 MB | Hub | ~22 ms/256 tok en EdgeTPU; ARM por medir |
| LLM interactivo | Qwen3 1.7B Q4 / Qwen2.5-1.5B | ~1.1 GB | Hub (NPU AX630C) | clase 10–17 t/s en Pi 5 CPU; NPU AX630C soporta 0.5–1.5B oficialmente |
| LLM profundo + compromisos | Qwen3 4B / Gemma 3 4B QAT | ~2.8 GB | Nido | 3.5–5 t/s en Pi 5; 5–8 t/s en RK3588; en un mini-PC x86 o la GPU del cliente, 30+ t/s |
| VLM escenas | Moondream 0.5B / LFM2.5-VL-450M | 375–450 MB | Nido | 816 MB RAM runtime; LFM2.5-VL es multilingüe |
| OCR | RapidOCR (Paddle/ONNX); Tesseract fallback | ~50 MB | Nido | Paddle: 0 errores vs 3 de Tesseract en benchmark de facturas |
| TTS es | Piper (voz es_MX) | ~60 MB | Hub | tiempo real en clase Pi 4 |
- Actualización de modelos sin nube: los pesos llegan dentro del bundle RAUC firmado, igual que el firmware. Un despliegue air-gapped recibe los bundles por USB. La memoria mejora con cada release re-procesando el archivo local (§09) — el dato nunca viaja hacia el modelo; el modelo viaja hacia el dato.
- Cero telemetría por defecto. El canal de diagnóstico es opt-in, agregado y visible en texto plano antes de enviarse. Es lo contrario del estándar de la industria, y por eso es vendible en §19.
- La lección Humane, como requisito de ingeniería: el producto entero debe pasar la prueba "InGrid quiebra mañana": sin servidores de licencia, sin activación en línea, sin kill-switch remoto. HP pagó $116 M por los restos de Humane y los dispositivos murieron en 10 días. Un NeuroLens sin InGrid sigue siendo un NeuroLens.
13Estrategia de patentes
IP de pobre bien jugada: una patente núcleo, muralla de prior art alrededor, y marca antes que todo.
Qué sí es patentable nuestro (las dos solicitudes)
- "Módulo retrofit de memoria con captura condicionada por hardware": el sistema clip-agnóstico (mordaza adaptativa + alineación de cámara a la mirada) combinado con la cadena de encendido AAD→VAD→captura y el interlock físico LED-riel de captura. Es la reivindicación que un competidor grande no puede rodear sin renunciar a features de nube (§20).
- "Ciclo de vida de memoria dividida con borrado verificable": la arquitectura clip/hub/nido con llaves de pareo, retención por política y purga auditada — el mecanismo, no la idea de "memoria local".
Secuencia y costos reales
| Mes | Acción | Costo real |
|---|---|---|
| 0 | Marca primero: registro de "NeuroLens" e "InGrid Solutions" ante el IMPI (en línea, por clase) | ~MXN 2,814 por clase |
| 0–3 | Bitácora de invención con fechas (el repo git con commits firmados sirve) + búsqueda de prior art propia | $0 |
| 3–6 | 2 provisionales US (tasa micro entity $65–130; redacción con abogado $2–6 k c/u, o redacción propia + revisión) | ~$5–13 k |
| 6–17 | Publicación defensiva de todo lo periférico (formatos de momento, huella de radio, esquema SQLite) vía IP.com — crea prior art que bloquea a terceros, cuesta centavos y no revela más de lo que el open-core ya publica | <$500 |
| 12 | Decisión PCT con dinero de seed (tasas+abogado $3–6 k; la fase nacional de $30–50 k por jurisdicción se difiere hasta el mes 30) | $3–6 k |
| continuo | Secreto industrial (LFPPI en México / DTSA en EE.UU.) para lo que no se ve: pesos afinados, datasets de evaluación, calibración del beamforming — el modelo SpaceX: no publiques el recetario | disciplina, no dinero |
Contexto de por qué esto importa aunque la startup sea chica: las 300+ patentes de Humane fueron el piso de valor — HP pagó $116 M por una empresa muerta. Una cartera de 2 patentes núcleo + muralla defensiva convierte el peor escenario (el producto no pega) en un activo vendible, y el mejor escenario (pega) en algo que Meta no puede clonar impunemente — la demanda de Solos demuestra que a los grandes sí se les cobra.
14Modelo SaaS
Open-core: el dispositivo es tuyo; la operación de flota es nuestra renta.
La paradoja aparente — ¿cómo cobra suscripción una empresa cuya bandera es "no dependas de nosotros"? — se resuelve mirando a quién se le cobra. El individuo es dueño de su memoria, gratis para siempre. La empresa paga por operar flotas de memorias: aprovisionamiento, políticas, cumplimiento y auditoría. Exactamente el modelo SparkFun/Prusa (comunidad abierta + ejecución) fundido con el de Plaud (hardware + software de pago: >$100 M ARR, ~50% de conversión).
| Tier | Precio | Qué incluye | Para quién |
|---|---|---|---|
| Core (abierto) | $0 | Firmware del clip, stack del hub, app de línea de tiempo, exportación total. Repo público (licencia tipo GPLv3 para firmware, AGPL para el server core) | Individuos, makers, y la comunidad que audita que de verdad nada sale del dispositivo — la auditoría pública ES el marketing |
| Pro | $12/usuario/mes [EST] | Nido personal multi-dispositivo, re-proceso automático con modelos nuevos, integraciones (ICS, CalDAV, export a Obsidian/Markdown), soporte | Profesional independiente: consultores, abogados, médicos, DBAs :) |
| Enterprise | $25–35/seat/mes [EST] (mín. 20 seats) | NeuroLens Server on-prem: MDM de clips, geocercas de no-captura, políticas de retención centrales, bitácora de auditoría inmutable, SSO/SCIM, modo works-council (§16), SLA | Telecom, data centers, manufactura, salud — el que hoy paga $2,900 por un RealWear más suscripción opaca |
| Compliance+ | add-on 30% [EST] | Paquete regulatorio por jurisdicción (plantillas de aviso de privacidad LFPDPPP, DPIA GDPR, matriz BIPA/CIPA por estado), reportes listos para auditor | Regulados: banca, salud, gobierno |
- Anti-jugada de los incumbentes: TeamViewer Frontline y similares venden solo por cotización. Publicar precios es una táctica de confianza barata que ningún incumbente puede copiar sin canibalizar sus deals actuales.
- La renovación se gana con el archivo: cada trimestre de uso hace la memoria de flota más valiosa (activos documentados, procedimientos capturados, onboarding de técnicos nuevos con la memoria de los veteranos). El churn natural de un producto de memoria es bajísimo — irse cuesta el archivo operativo. Y como el dato es exportable (§08), la retención es por valor, no por rehén: defendible frente a competencia y frente a reguladores.
15Estrategia de monetización a 10 años
Cuatro actos. Cada uno financia el siguiente y ninguno apuesta la empresa.
| Acto | Años | Motor de ingreso | Objetivo de salida del acto [EST] |
|---|---|---|---|
| I — Servicios con producto embrionario | 1–2 | Pilotos pagados (10–50 unidades) + consultoría de despliegue. El piloto se cobra: $15–25 k por 90 días con hardware incluido — el cliente que no paga piloto no compra flota | 3–5 pilotos convertidos, ~$150–300 k ingresos, métricas de ROI documentadas |
| II — Producto | 3–4 | Hardware con margen (clip+hub ~$499, margen bruto >50% a 1 k units; §18) + SaaS enterprise. LATAM primero: español nativo local es ventaja estructural, no feature | 2,000–5,000 seats activos, ARR $1.5–4 M, hardware ya no es >50% del ingreso |
| III — Plataforma | 5–7 | SDK de "momentos" para ISVs (el CMMS del cliente lee compromisos; el ticketing crea tickets desde voz), certificaciones sectoriales, marketplace de integraciones con rev-share | ARR $10–30 M, expansión EE.UU./UE con el paquete Compliance+ como ariete |
| IV — Estándar e IP | 8–10 | Licenciamiento del stack de memoria local a OEMs de lentes (los que hoy no tienen historia de privacidad la necesitarán), NeuroLens Server como capa de memoria para cualquier wearable, cartera de patentes madura | El negocio de referencia: Plaud pasó de 0 a $100M+ ARR en ~3 años solo con audio — el techo de la categoría es real |
16Riesgos legales
El riesgo legal no se gestiona con un aviso: se gestiona con arquitectura. Cada mitigación de esta tabla ya es una decisión de diseño de las secciones anteriores.
Mapa de riesgo → mitigación de diseño
| Riesgo | Norma / precedente | Exposición | Mitigación arquitectónica |
|---|---|---|---|
| Grabar conversaciones de terceros donde el usuario no participa | México: CPF Art. 177 (intervención de comunicación ajena = delito, 6–12 años); la SCJN solo protege grabar la conversación propia | penal | El beamforming apunta al interlocutor de frente + VAD de conversación propia; el modo por defecto descarta voz lejana/ambiental [EST — validar umbral en piloto]. Posicionamiento de producto: "memoria de TUS conversaciones", jamás "escucha ambiental" |
| Estados all-party de EE.UU. | CIPA California §632: $5,000 por conversación en vía civil sin daño probado; Brewer v. Otter.ai (2025) es la plantilla de demanda contra productos de transcripción | civil, class action | Perfil regional obligatorio en el aprovisionamiento: en CA/IL/FL/WA el clip exige confirmación de aviso al inicio de cada momento con hablantes nuevos + el LED hardware; Otter cayó por grabar por defecto y entrenar con los datos — NeuroLens no entrena con datos de clientes, punto |
| Voiceprints | BIPA Illinois: $1–5 k por violación; clase de 1.2 M certificada vs Amazon Voice ID (nov-2025) | civil, class action | Diarización efímera por sesión (§05): no se persiste ningún vector de voz. La feature "reconoce quién habla entre sesiones" NO se construye, por rentable que parezca |
| Reconocimiento facial | BIPA + Texas CUBI (Meta pagó $1.4 B a Texas) + GDPR art. 9 | existencial | No existe en el producto. El VLM describe escenas sin identificar personas; no hay face embeddings en ninguna parte del stack |
| Emociones de empleados | EU AI Act Art. 5(1)(f): emotion recognition en el trabajo PROHIBIDA desde feb-2025; multa €35 M o 7% global | regulatoria máxima | Ninguna inferencia de emoción, sentimiento o estado anímico en ningún nivel. También excluida del roadmap: es la línea que convierte un asistente en un vigilante |
| Datos personales México | Nueva LFPDPPP (DOF 20-mar-2025, vigente 21-mar-2025; autoridad ahora en la Secretaría Anticorrupción y Buen Gobierno tras la extinción del INAI); multas hasta 320,000 UMA ≈ MXN 36 M; reglamento aún pendiente a 2026 | administrativa | Aviso de privacidad por flota (lo genera Compliance+), plazos de conservación/supresión nativos en la tabla de políticas (§08), borrado auditable, consentimiento del titular en el enrolamiento |
| Vigilancia laboral | LFT (cámaras/audio generalizado prohibido salvo excepción; teletrabajo Art. 330-I); Alemania: co-determinación del works council §87 BetrVG; reforma LFT de IA en curso (2026) | laboral + reputacional | El dispositivo es del trabajador, no del patrón: el empleador administra políticas y geocercas pero NO puede leer la memoria individual (llave por usuario, §08). "Modo works council": reporte imprimible de qué captura y qué no. Esto invierte el pitch: NeuroLens protege al técnico (su evidencia, sus compromisos) en vez de vigilarlo |
| Zonas prohibidas | Baños/vestidores (LFT), áreas de cliente, hospitales | penal/civil | Geocercas por huella de radio (§07): en zona roja el clip corta el riel de captura por hardware y el LED lo muestra. La lista de zonas la carga el cliente, no nosotros |
| Contenido íntimo accidental | Ley Olimpia (CPF 199 octies: 3–6 años); Bartone v. Meta (mar-2026): contratistas revisando footage íntimo | penal + reputacional | Nadie de InGrid puede ver contenido de usuarios NUNCA (no hay revisión humana porque no hay nube que revisar) — el riesgo Bartone es estructuralmente imposible aquí. Borrado inmediato por voz ("olvida esto") siempre disponible |
| El precedente social | Google Glass murió por "glasshole" antes que por hardware; crisis Meta 2026 | mercado | Por eso el beachhead es industrial (§19): en un data center o una planta, un wearable con LED es EPP, no una amenaza social. El consumer general no es el mercado de entrada — es el acto IV, si acaso |
17Roadmap: de MVP a Unicornio
Con compuertas de salida honestas. Cada etapa tiene una condición medible para avanzar — o para parar.
| Hito | Cuándo | Qué se construye | Compuerta para avanzar |
|---|---|---|---|
| M0 — Prototipo v0 | Semanas 1–8 | Clip con Luckfox+SC3336+mics en montura impresa; hub = la laptop actual (el stack Ollama/whisper ya existe y ya está afinado); pipeline completo captura→momento→consulta usándolo nosotros a diario | Yo respondo "¿qué me dijeron ayer sobre X?" correctamente 8 de 10 veces, con <$250 gastados |
| M1 — Dogfood real | Meses 3–5 | 3–5 unidades para colegas de confianza (con consentimiento firmado del equipo); hub LLM630; arnés de evaluación (§11) corriendo; primeras garras TPU multi-armazón | Uso voluntario sostenido >3 semanas sin que se lo quiten; NPS informal >7 |
| M2 — Piloto pagado #1 | Meses 6–10 | PCB v1 (10–20 unidades), NeuroLens Server alfa en un cliente que ya nos conoce (el ecosistema telecom propio es la puerta natural); provisionales US presentadas; constitución formal de InGrid | Un cliente PAGA el piloto ($15 k+) y firma carta de intención de flota |
| M3 — Seed | Meses 10–14 | Con el piloto convertido como tracción: ronda seed ($500 k–1.5 M [EST]) para 200–500 unidades, certificación NOM/FCC/CE del clip, 2–3 contrataciones (firmware, ventas enterprise) | 3 clientes de pago, ≥300 seats comprometidos |
| M4 — Producto v2 | Años 2–3 | Molde de inyección, eMMC industrial, hub PCB propia, Compliance+ para México/EE.UU.; canal de integradores (los SIs que ya despliegan RealWear buscan alternativa más barata) | ARR >$1.5 M, margen bruto combinado >55%, churn lógico <5% anual |
| M5 — Serie A y expansión | Años 3–5 | EE.UU. industrial + UE con el AI Act como viento de cola (somos de los pocos que cumplen por diseño); SDK de plataforma (acto III de §15) | ARR $10 M+, un logo Fortune 500 o equivalente LATAM (América Móvil, FEMSA, Bimbo...) |
| M6 — La apuesta grande | Años 5–10 | Licenciamiento OEM del stack (§15 acto IV), categoría "memoria profesional certificada" creada, M&A selectivo de verticales | Camino a $100 M ARR — el múltiplo de la categoría (Plaud como comparable) es lo que sostiene una valuación de unicornio |
18Costos reales de fabricación
Del protoboard al contenedor: números con fuente, supuestos marcados.
Escalera de costo unitario (clip + hub)
| Volumen | Clip | Hub | Costo total | Qué cambia |
|---|---|---|---|---|
| v0 (1–5, módulos) | ~$95 | $100–130 | ~$226 | Dev boards + impresión FDM propia (BOM §03) |
| v1 (100, PCB propia) | ~$62 [EST] | ~$85 [EST] | ~$147 | RV1106 SiP ~$8–12 en volumen, PCBA en fab mexicana o JLC; carcasas MJF; celdas certificadas IEC 62133 |
| 1,000 | ~$38 [EST] | ~$60 [EST] | ~$98 | Molde amortizado, compra de componentes por reel, test fixture propio |
| 10,000 | ~$27 [EST] | ~$45 [EST] | ~$72 | Negociación directa con Rockchip/Axera; ensamble final en México (ventaja arancelaria T-MEC para vender a EE.UU.) |
Ancla de realismo: el BOM verificado de v0 suma $226 con precios retail unitarios; la regla industrial de que el costo de módulos retail ≈ 2–2.5× el BOM de producción a 1 k unidades sostiene las celdas [EST]. Los Ray-Ban Meta se venden a $379 con una estructura de costos de gigante; NeuroLens a $499 con costo ~$98 a 1 k unidades da margen bruto de hardware ~60% — sin subsidio cruzado de nube.
Costos no recurrentes (NRE) hasta producto certificado
| Concepto | Rango [EST] | Nota |
|---|---|---|
| Diseño PCB v1 + 3 respins | $8–20 k | Menos si el layout es propio y solo se paga fab+ensamble de prototipos |
| Molde de inyección (2 cavidades: shell + tapa) | $8–15 k | Diferible: hasta 500 uds, MJF/SLS es más barato por pieza total |
| Certificaciones radio/seguridad: FCC + IC, CE-RED, NOM-208/NYCE | $15–35 k | Usar módulo WiFi pre-certificado en v1 recorta el alcance del test intencional |
| Batería: UN 38.3 (transporte) + IEC 62133 | $3–8 k | O comprar celdas ya certificadas del catálogo del fabricante (la vía barata) |
| Legal: 2 provisionales + marcas + contratos marco | $8–18 k | Desglose en §13 |
| Total NRE a producto vendible | $42–96 k | Dimensiona el seed de M3; el piloto M2 se hace ANTES de gastar la mayor parte de esto |
19Plan de venta a sectores industriales
Beachhead propuesto con datos: mantenimiento de infraestructura crítica en LATAM — telecom, data centers, energía.
Por qué ese beachhead y no otro
- El ROI de la categoría ya está probado por otros: DHL midió +15% de productividad con vision picking y lo volvió estándar global; Honeywell reportó −50% en costos de viaje con RealWear; Amazon está expandiendo Vuzix Ultralite Pro para mantenimiento de sus data centers de IA (Q2 2026). No hay que evangelizar la categoría — hay que ganar el deal con precio, español y soberanía de datos.
- El incumbente cuesta 4–6× y habla inglés: RealWear Navigator $2,900 + suscripción por cotización; su control de voz soporta español pero su IA y su stack son nube. En LATAM el costo por técnico es la variable que mata proyectos.
- La soberanía de datos es requisito duro, no preferencia: un carrier no puede mandar el audio de su NOC a Meta; un banco no puede mandar el piso de su data center a Gemini; el sector público ni hablar. El único competidor "on-device" del mercado consumer (Brilliant Labs Halo) sigue mandando su agente a la nube. En infraestructura crítica, NeuroLens no tiene competidor directo hoy (ago-2026).
- Lo conocemos desde adentro: el fundador ha operado bases de datos de carrier por años — sabe qué evidencia pide una auditoría, cómo se ve una ventana de cambio a las 2 AM, y qué significa que un compromiso verbal de un proveedor no quede registrado. El primer usuario del producto es su propio autor. Ese es el estándar de credibilidad que un gerente de operaciones respeta.
Los tres casos de uso que se venden (con la métrica que los paga)
| Caso | Hoy | Con NeuroLens | Métrica de ROI |
|---|---|---|---|
| Evidencia de ventana de cambio | El técnico interrumpe para fotografiar, transcribir y armar el correo de evidencia; 30–60 min por ventana | Momentos con audio, capturas y compromisos ya indexados; el reporte se genera del archivo | horas-hombre por cambio; disputas de "quién dijo qué" con proveedor |
| Traspaso de turno / onboarding | El conocimiento vive en la cabeza del veterano; el nuevo tarda meses | La memoria de sitio consultable: "¿cómo se resolvió esto la última vez?" con la voz del que lo resolvió | tiempo a productividad del técnico nuevo; MTTR de incidentes repetidos |
| Inspección con manos ocupadas | Libreta, teléfono, o nada | Captura por voz y por mirada; OCR de etiquetas y seriales directo al inventario | exactitud de inventario; hallazgos por hora de inspección |
Motion de venta
- Piloto pagado de 90 días (10 unidades, $15–25 k, éxito definido por contrato con las métricas de arriba). Se vende al gerente de operaciones/campo, no a TI — TI se gana con el argumento on-prem.
- Desactivador de objeciones legal/laboral en la primera junta: el kit de §16 (LED físico, geocercas, llave del trabajador, modo works council). La objeción #1 en esta categoría no es técnica, es "el sindicato/legal no lo va a permitir" — llegar con eso resuelto acorta el ciclo meses.
- Convertir a flota con precio público por seat (§14) — sin la danza de cotizaciones de los incumbentes.
- Canal: integradores regionales que ya venden RealWear/Zebra a estas cuentas y quieren margen en una alternativa; después, alianzas con los ISVs de mantenimiento (CMMS/EAM) vía el SDK del acto III.
20Ventajas competitivas imposibles de copiar
Con precisión: "imposible de copiar" no existe. Existe "estructuralmente carísimo de copiar para cada competidor concreto". Ese es el estándar de esta sección.
| Moat | Por qué nos protege | Contra quién |
|---|---|---|
| 1 · Local-first como modelo de negocio, no como feature | Meta, Google y Amazon no pueden vender memoria que no ven: su unidad económica es el dato en su nube (ads, entrenamiento, lock-in). Copiarnos exige canibalizar su propio modelo — el dilema del innovador en su forma más pura. La evidencia de que lo saben: compraron Limitless y Bee en vez de construir local | Hyperscalers |
| 2 · Neutralidad de armazón | Meta está casada con EssilorLuxottica; cada fabricante de lentes que no sea Luxottica es nuestro canal potencial, no nuestro competidor. El retrofit convierte a toda la industria óptica instalada (miles de millones de armazones) en superficie compatible | Meta/Luxottica, marcas verticales |
| 3 · Cumplimiento por arquitectura | El AI Act, BIPA, CIPA y la LFPDPPP castigan exactamente el diseño nube-céntrico de los incumbentes (Otter, Meta y Amazon ya están demandados o pagando). Nosotros cumplimos por construcción — LED físico, sin voiceprints, sin caras, sin nube. Re-arquitecturar un producto nube para igualar esto cuesta años; nosotros nacimos aquí | Todos los incumbentes de nube |
| 4 · Español e infraestructura LATAM como profundidad, no traducción | ASR afinado a español técnico de campo (jerga telecom/eléctrica mexicana), plantillas LFPDPPP, precios en pesos, soporte en el huso del cliente. Para un gigante, LATAM industrial es el mercado #7 de su lista; para nosotros es el único. La profundidad le gana al presupuesto en mercados que el grande atiende con sobras | Vuzix/RealWear, startups US |
| 5 · Open-core con comunidad de auditoría | "No sale nada del dispositivo" solo es creíble si cualquiera puede leer el código — y una comunidad que audita, extiende y porta el firmware es un activo que el dinero no compra rápido (Arduino/Prusa/SparkFun llevan décadas demostrándolo). El fork comercial sin la comunidad es una carcasa | Clones de bajo costo |
| 6 · El archivo del cliente | Cada mes de uso, la memoria de flota vale más y migrarla — aun siendo exportable — pierde el contexto operativo vivo. Retención por valor acumulado: el moat clásico de los sistemas de registro (ERP, CRM), aplicado por primera vez a la memoria de campo | Cualquier entrante tardío |
A1Anexo — Lo no verificado
Todo lo marcado [EST] en el documento, consolidado. Son estimaciones de ingeniería o supuestos de negocio pendientes de medición — el plan de v0/M1 existe en buena parte para convertir esta lista en datos:
- Presupuesto térmico de 0.3–0.55 W en la sien (cálculo propio desde límites de piel publicados; validar con termopar en v0).
- Reparto 85/15 de escucha pasiva/activa y las autonomías derivadas del clip.
- RTF de whisper/EmbeddingGemma/Qwen en el AX630C específicamente (los números citados son de RK3588/Pi 5; el M5Stack lista los modelos como soportados pero no publica RTF).
- FPS reales de YOLOv8n en el NPU del RV1106 (el dato medido es de la clase RK3566).
- Umbral de descarte de voz lejana (mitigación Art. 177) — requiere calibración de campo.
- Costos unitarios a 100/1k/10k unidades y todos los NRE (rangos de industria, no cotizaciones).
- Precios de SaaS ($12/$25–35) — hipótesis a validar contra el piloto M2.
- Geometrías de patillas comerciales (medir muestra real antes de congelar las garras S/M/L).
- Momentos por jornada (15–40) — supuesto de diseño.
- La caracterización "retrofit + memoria local = área de patentes despejada" es inferencia desde los clusters públicos y litigios; requiere FTO profesional (§13).
A2Anexo — Fuentes principales
Mercado: Counterpoint (envíos H2-2025 +139%, cuotas Q1-2026) · IDC (forecast 2026–2030, CAGRs) · Omdia (AI glasses 5.1 M→10 M) · UploadVR/CNBC (Meta 7 M unidades 2025) · TechCrunch (Plaud $100 M ARR; adquisiciones Limitless→Meta dic-2025 y Bee→Amazon 2025; Humane→HP $116 M) · Road to VR / Tom's Guide / TechRadar (precios y specs de Ray-Ban Display $799, G2 $599, Halo $299–349, RayNeo X3 Pro $1,169, Rokid $499, Vuzix M400 ~$2,000 / Z100 $499, RealWear Navigator 520 $2,900, Iristick G2 Pro $3,637) · Yanko Design (CAMIO $79) · Seeed (OpenGlass) · informes Vuzix Q1/Q2-2026 · casos DHL, Honeywell, Amazon–Vuzix.
Hardware: luckfox.com (Pico Ultra $26.99) · Waveshare (SC3336 $8.99) · Adafruit (ICS-43434, MAX98357A, BQ24074, MAX17048, transductor óseo) · M5Stack (LLM630 $99.90, AX630C 0.5/1.5 W) · Radxa/ALLNET (Zero 3W) · Sipeed (LicheeRV Nano) · CNX Software (consumos Pi Zero 2 W) · xMEMS/Electronic Design (límites térmicos 41–48 °C) · Oxeltech/UL (seguridad LiPo) · TDK (T5848 AAD) · Memfault (throughput BLE).
IA offline: Turing Pi (whisper.cpp RTF en RK3588) · whisper.cpp #166 (Pi 4 streaming) · alphacephei (Vosk es) · k2-fsa/sherpa-onnx (NeMo es, diarización) · papers Moonshine v2 + moonshine-voice PyPI (español ago-2026) · Google (EmbeddingGemma) · asg017/sqlite-vec (v0.1.9–v0.1.10) · Marco Bambini (benchmarks vectoriales SQLite) · LanceDB docs · moondream.ai · LearnOpenCV (VLMs en Pi) · Qengineering (YOLO NPU) · Kevin Chen (teardown Rewind) · retrace/OpenRecall (GitHub) · DeepWiki Omi (nRF5340+AAD) · localaimaster/kunalganglani/Adafruit (LLMs en Pi 5).
Legal: Justia/CELE (CPF 177/211 bis) · SCJN vía La Silla Rota jul-2026 (grabación por participante) · Hogan Lovells/KPMG/IAPP/AMDA (nueva LFPDPPP 2025, SABG, multas UMA) · King & Spalding/Duane Morris (BIPA, reforma SB 2979, clase Amazon Voice ID) · Texas AG (Meta $1.4 B CUBI) · RecordingLaw (estados all-party, CIPA §632/637.2) · William Fry + artificialintelligenceact.eu + Gibson Dunn (AI Act Art. 5(1)(f), multas, Digital Omnibus) · NPR (Brewer v. Otter.ai) · TechCrunch/Clarkson (Bartone v. Meta) · Fortune (crisis LED 2026) · PRNewswire/Mondaq (Solos v. Meta ene-2026) · Tom's Guide (Xreal v. Viture) · GreyB (Magic Leap 8,555 patentes) · TriangleIP/UpCounsel (costos US/PCT) · Vanguardia/IMPI (tarifas México) · Infobae (LFT vigilancia) · Engineering.com/IP.com (publicación defensiva) · Mathys & Squire (SpaceX trade secrets) · Opensource.com (modelo SparkFun).