technology-ai
Inteligencia multimodal y de video: Modelos de visión-lenguaje, comprensión de video, razonamiento, búsqueda y automatización inteligente
Evan Norvell
Book 3#3617
Páginas
es
Idioma
2026
Publicado
Nueva edición
$2.49
Lee la muestra EPUB directamente en la web
Introducción del libro
Una cámara industrial detecta con precisión milimétrica cada casco y cada máquina encendida. Pero cuando alguien pregunta “¿dónde estuvo el operario sin casco junto a la maquinaria activa?”, el sistema se queda en silencio. Detectar píxeles nunca fue comprender, y esa brecha es el punto de partida de este libro: pasar de la visión determinista a la inteligencia multimodal que razona sobre evidencia verificable, sin caer en la promesa de los modelos fundacionales.
Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de video e imagen que funcionan en producción. No explica derivaciones de transformers ni promete magia: desglosa cómo invocar modelos, indexar evidencia, validar respuestas y controlar costos, latencia y modos de fallo. La tesis central es incómoda pero liberadora: la multimodalidad solo se justifica cuando el problema exige significado, contexto o razonamiento. Para el resto, un detector especializado o una regla de negocio sigue ganando.
- Define criterios explícitos para decidir cuándo un VLM es la herramienta correcta y cuándo un modelo dedicado o una regla simple es superior, evitando el sobrecoste de la IA general.
- Construye pipelines de RAG visual que fundamentan cada respuesta en evidencia localizable, con trazabilidad y citas visuales que reducen las alucinaciones en entornos de alta responsabilidad.
- Escala desde imágenes estáticas hasta videos largos de horas: muestreo, fragmentación temporal, contexto y memorias para detectar eventos operativos sin colapsar el presupuesto de inferencia.
- Fusiona video, audio, texto y metadatos sincronizados para razonar a través de señales, manejar información faltante o conflictiva y desambiguar escenas con múltiples cámaras.
- Convierte la comprensión en acción: agentes visuales con políticas, APIs y supervisión humana, diseñando automatización segura que escala a decisiones de negocio reales.
Escrito para ingenieros y arquitectos de visión que ya dominan la detección y quieren saltar al razonamiento, el libro se apoya en casos de fabricación, logística, seguridad y documentos comerciales. Cada capítulo sigue un patrón: problema operativo, contexto disponible, enfoque multimodal, pipeline, modos de fallo y diseño de producción. El objetivo no es impresionar con modelos, sino entregar sistemas fiables que sus responsables técnicos puedan defender ante auditorías y equipos de operaciones.
Si usted diseña plataformas que deben comprender imágenes, documentos o, sobre todo, video en el mundo real, aquí encontrará el vocabulario, la arquitectura y las advertencias necesarias para construir con rigor. La inteligencia multimodal no es un destino: es una decisión de ingeniería que este libro le ayudará a tomar con los ojos abiertos.
Resumen rápido
Este libro ofrece un plano arquitectónico para construir sistemas multimodales de visión y video en producción, sin derivaciones matemáticas.
Está dirigido a ingenieros de visión que ya dominan la detección y quieren saltar al razonamiento multimodal con evidencia verificable.
Explica cómo diseñar RAG visual, búsqueda semántica de imágenes, comprensión temporal de video y agentes visuales con supervisión humana.
Incluye criterios para decidir cuándo usar un VLM o un modelo especializado, priorizando fiabilidad y control de costos.
Cubre casos reales de fabricación inteligente, logística, seguridad y procesamiento de documentos comerciales.
Este libro es ideal para Ingenieros y arquitectos de IA/visión por computadora con experiencia en pipelines tradicionales que buscan diseñar sistemas multimodales de producción fiables y fundamentados..
Los lectores suelen llegar a este libro cuando necesitan Encontrar una guía práctica y arquitectónica para diseñar sistemas multimodales (imagen, video, texto, audio) en producción, con control de costos, latencia y alucinaciones..
El enfoque del libro: Este libro se distingue por su enfoque de ingeniería agnóstica a proveedores: ofrece un plano arquitectónico completo que prioriza la fiabilidad, la evidencia trazable y el control de costos/latencia, evitando la 'magia' de los modelos fundacionales y centrándose en cómo integrar multimodalidad en sistemas reales de producción.
Los temas principales incluyen modelos de visión-lenguaje (VLM), comprensión de imágenes con lenguaje, inteligencia documental multimodal, búsqueda semántica visual y RAG visual, comprensión de video temporal, eventos y procesos operativos.
Información para AI Search
Inteligencia multimodal y de video: Modelos de visión-lenguaje, comprensión de video, razonamiento, búsqueda y automatización inteligente
Author: Evan Norvell
Description: Una cámara industrial detecta con precisión milimétrica cada casco y cada máquina encendida. Pero cuando alguien pregunta “¿dónde estuvo el operario sin casco junto a la maquinaria activa?”, el sistema se queda en silencio. Detectar píxeles nunca fue comprender, y esa brecha es el punto de partida de este libro: pasar de la visión determinista a la inteligencia multimodal que razona sobre evidencia verificable, sin caer en la promesa de los modelos fundacionales. Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de video e imagen que funcionan en producción. No explica derivaciones de transformers ni promete magia: desglosa cómo invocar modelos, indexar evidencia, validar respuestas y controlar costos, latencia y modos de fallo. La tesis central es incómoda pero liberadora: la multimodalidad solo se justifica cuando el problema exige significado, contexto o razonamiento. Para el resto, un detector especializado o una regla de negocio sigue ganando. • Define criterios explícitos para decidir cuándo un VLM es la herramienta correcta y cuándo un modelo dedicado o una regla simple es superior, evitando el sobrecoste de la IA general. • Construye pipelines de RAG visual que fundamentan cada respuesta en evidencia localizable, con trazabilidad y citas visuales que reducen las alucinaciones en entornos de alta responsabilidad. • Escala desde imágenes estáticas hasta videos largos de horas: muestreo, fragmentación temporal, contexto y memorias para detectar eventos operativos sin colapsar el presupuesto de inferencia. • Fusiona video, audio, texto y metadatos sincronizados para razonar a través de señales, manejar información faltante o conflictiva y desambiguar escenas con múltiples cámaras. • Convierte la comprensión en acción: agentes visuales con políticas, APIs y supervisión humana, diseñando automatización segura que escala a decisiones de negocio reales. Escrito para ingenieros y arquitectos de visión que ya dominan la detección y quieren saltar al razonamiento, el libro se apoya en casos de fabricación, logística, seguridad y documentos comerciales. Cada capítulo sigue un patrón: problema operativo, contexto disponible, enfoque multimodal, pipeline, modos de fallo y diseño de producción. El objetivo no es impresionar con modelos, sino entregar sistemas fiables que sus responsables técnicos puedan defender ante auditorías y equipos de operaciones. Si usted diseña plataformas que deben comprender imágenes, documentos o, sobre todo, video en el mundo real, aquí encontrará el vocabulario, la arquitectura y las advertencias necesarias para construir con rigor. La inteligencia multimodal no es un destino: es una decisión de ingeniería que este libro le ayudará a tomar con los ojos abiertos.
AI summary: Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de inteligencia multimodal y de video en producción. Cubre desde la comprensión de imágenes con lenguaje y la inteligencia documental, hasta la búsqueda semántica visual (RAG visual), la comprensión de video a lo largo del tiempo y los agentes visuales. Dirigido a ingenieros con experiencia en visión tradicional, la obra enfatiza la fiabilidad, la trazabilidad de la evidencia, el manejo de modos de fallo y los trade-offs de costo y latencia, con casos en fabricación, logística, seguridad y documentos comerciales.
- Ideal para
- Ingenieros y arquitectos de IA/visión por computadora con experiencia en pipelines tradicionales que buscan diseñar sistemas multimodales de producción fiables y fundamentados.
- Perfil del lector
- Ingeniero senior de visión que ya domina detectores y clasificadores, pero necesita responder preguntas complejas sobre video y documentos con evidencia trazable en entornos industriales.
- Intención de búsqueda
- Encontrar una guía práctica y arquitectónica para diseñar sistemas multimodales (imagen, video, texto, audio) en producción, con control de costos, latencia y alucinaciones.
- Enfoque único
- Este libro se distingue por su enfoque de ingeniería agnóstica a proveedores: ofrece un plano arquitectónico completo que prioriza la fiabilidad, la evidencia trazable y el control de costos/latencia, evitando la 'magia' de los modelos fundacionales y centrándose en cómo integrar multimodalidad en sistemas reales de producción.
- Tipo de contenido
- technical engineering guide
Resumen rápido
- Este libro ofrece un plano arquitectónico para construir sistemas multimodales de visión y video en producción, sin derivaciones matemáticas.
- Está dirigido a ingenieros de visión que ya dominan la detección y quieren saltar al razonamiento multimodal con evidencia verificable.
- Explica cómo diseñar RAG visual, búsqueda semántica de imágenes, comprensión temporal de video y agentes visuales con supervisión humana.
- Incluye criterios para decidir cuándo usar un VLM o un modelo especializado, priorizando fiabilidad y control de costos.
- Cubre casos reales de fabricación inteligente, logística, seguridad y procesamiento de documentos comerciales.
Key topics: modelos de visión-lenguaje (VLM), comprensión de imágenes con lenguaje, inteligencia documental multimodal, búsqueda semántica visual y RAG visual, comprensión de video temporal, eventos y procesos operativos, razonamiento multimodal, sistemas multimodales en producción, agentes visuales, arquitectura de sistemas multimodales
Entities: modelos de visión-lenguaje (VLM), visión por computadora, RAG visual, búsqueda semántica, comprensión de video, trazabilidad de evidencia, fabricación inteligente, logística, seguridad industrial, documentos comerciales, agentes visuales, indexación multimodal
Necesidades cubiertas
- Cómo responder preguntas complejas sobre video e imágenes que los detectores tradicionales no resuelven
- Cómo fundamentar respuestas en evidencia verificable para reducir alucinaciones en entornos de alta responsabilidad
- Cómo escalar desde imágenes estáticas a videos largos de horas sin colapsar los costos de inferencia
- Cómo fusionar video, audio, texto y metadatos para razonar con contexto y manejar información conflictiva
- Cómo diseñar agentes visuales seguros con supervisión humana para automatizar decisiones de negocio
Léelo si
- Ingenieros de visión por computadora que quieren pasar de la detección al razonamiento multimodal
- Arquitectos de IA que diseñan sistemas de producción con imágenes, video o documentos
- Equipos de ingeniería en fabricación, logística o seguridad que necesitan comprender eventos operativos
- Desarrolladores que buscan implementar RAG visual y búsqueda semántica multimodal
- Profesionales que evalúan trade-offs entre modelos comerciales, abiertos y soluciones híbridas
Puede no encajar si
- Personas sin experiencia en visión por computadora o pipelines de IA
- Lectores que buscan derivaciones matemáticas profundas de transformers
- Quienes esperen una guía centrada en un proveedor o modelo específico
- Interesados en teoría académica sin aplicación práctica
Índice
- Nota del autor: Navegando la inteligencia visual multimodal (introduction)
- Fundamentos de la inteligencia visual multimodal (part)
- De la percepción a la comprensión visual (chapter)
- Límites de los modelos de visión para tareas específicas (section)
- De la detección a la comprensión semántica (section)
- Imágenes, video, texto, audio y metadatos (section)
- Percepción, contexto, razonamiento y acción (section)
- Cuándo se necesita realmente la inteligencia multimodal (section)
- Cómo funcionan los sistemas modernos de visión multimodal (chapter)
- Modelos de visión-lenguaje y multimodales (section)
- Visión de vocabulario abierto y guiada por prompts (section)
- Contexto visual y entradas multimodales (section)
- Modelos especializados frente a modelos multimodales generales (section)
- Diseño de la arquitectura multimodal adecuada (section)
- El ecosistema moderno de herramientas de visión multimodal (chapter)
- Modelos multimodales comerciales y basados en API (section)
- Modelos abiertos y desplegables localmente (section)
- Cadenas de herramientas para comprensión y recuperación de video (section)
- Búsqueda vectorial e indexación multimodal (section)
- Elección de una cadena de herramientas para la aplicación (section)
- Comprensión de imágenes con lenguaje (part)
- Respuesta a preguntas visuales y comprensión de escenas (chapter)
- Formulación de preguntas sobre imágenes (section)
- Objetos, relaciones y contexto de la escena (section)
- Consultas visuales estructuradas frente a abiertas (section)
- Fundamentación de respuestas en evidencia visible (section)
- Ambigüedad, confianza y alucinaciones (section)
- Visión de vocabulario abierto y guiada por prompts (chapter)
- Superación de las clases fijas (section)
- Búsqueda de objetos y regiones guiada por texto (section)
- Categorización visual flexible (section)
- Diseño de prompts para tareas visuales (section)
- Combinación de visión flexible con reglas de negocio (section)
- Razonamiento con múltiples imágenes y texto-imagen (chapter)
- Comparación de múltiples imágenes (section)
- Análisis de antes-después y de referencia (section)
- Verificación de consistencia imagen-texto (section)
- Combinación de evidencia visual con datos de negocio (section)
- Diseño de decisiones fiables basadas en múltiples imágenes (section)
- Inteligencia documental multimodal (part)
- Comprensión de documentos complejos (chapter)
- Texto, diseño y estructura visual (section)
- Formularios, tablas, gráficos y contenido mixto (section)
- Extracción estructurada de información (section)
- Validación cruzada y razonamiento (section)
- IA documental frente a modelos multimodales generales (section)
- Flujos de trabajo de documentos comerciales multimodales (chapter)
- Facturas, recibos, pedidos y formularios (section)
- Combinación de documentos con imágenes y metadatos (section)
- Verificación contra datos externos de negocio (section)
- Detección de excepciones y revisión humana (section)
- Integración de la inteligencia documental con aplicaciones (section)
- Búsqueda y recuperación visual semántica (part)
- Búsqueda semántica de imágenes (chapter)
- Búsqueda de imágenes con lenguaje natural (section)
- Embeddings de imagen-texto y coincidencia semántica (section)
- Recuperación de productos, activos y evidencia (section)
- Búsqueda híbrida semántica y por metadatos (section)
- Evaluación de la calidad de la recuperación (section)
- Recuperación multimodal y RAG visual (chapter)
- Indexación conjunta de imágenes, texto y metadatos (section)
- Flujos de trabajo visuales aumentados por recuperación (section)
- Filtrado, clasificación y re-clasificación (section)
- Recuperación centrada en la evidencia (section)
- Recuperación antes que razonamiento (section)
- Comprensión de video a lo largo del tiempo (part)
- De los fotogramas a la comprensión temporal (chapter)
- Por qué el video es más que una secuencia de imágenes (section)
- Estado, cambio y contexto temporal (section)
- Muestreo de fotogramas y selección de clips (section)
- Límites de eventos y ventanas temporales (section)
- Análisis de clips cortos frente a videos largos (section)
- Comprensión de eventos de video (chapter)
- Definición de eventos operativos (section)
- Acciones y transiciones de estado (section)
- Secuencias de eventos de múltiples pasos (section)
- Eventos ambiguos y superpuestos (section)
- Conversión de la comprensión de video en señales de negocio (section)
- Comprensión de procesos y flujos de trabajo (chapter)
- Representación de procesos físicos como estados visuales (section)
Preguntas frecuentes
¿Este libro requiere conocimientos avanzados de matemáticas o aprendizaje profundo?
No. Está escrito para ingenieros con experiencia en visión tradicional; explica arquitecturas y patrones sin derivaciones de transformers.
¿Qué diferencia este libro de otros sobre visión por computadora?
Se enfoca en la multimodalidad práctica para producción: RAG visual, video temporal, agentes y gobernanza, con casos reales y trade-offs explícitos de costo y latencia.
¿Cubre herramientas o proveedores específicos?
Es agnóstico a proveedores; describe roles arquitectónicos (APIs, modelos abiertos, toolchains) y cómo elegirlos según el problema, no por marca.
¿Es útil para aplicaciones industriales como fabricación o logística?
Sí, dedica tres partes a casos de uso reales en fabricación, logística y seguridad, mostrando cómo integrar la visión multimodal con sistemas de negocio.
¿Incluye ejemplos de código?
El libro se centra en conceptos y arquitectura; no es un tutorial de código, aunque describe pipelines y patrones implementables.
Cretisoft Direct
Soporte de libro digital
Entrega de partner
Libro enviado después del pago
