technology-ai

Inteligencia multimodal y de video: Modelos de visión-lenguaje, comprensión de video, razonamiento, búsqueda y automatización inteligente

Evan Norvell

Book 3#3

617

Páginas

es

Idioma

2026

Publicado

Nueva edición

$2.49

Lee la muestra EPUB directamente en la web

Introducción del libro

Una cámara industrial detecta con precisión milimétrica cada casco y cada máquina encendida. Pero cuando alguien pregunta “¿dónde estuvo el operario sin casco junto a la maquinaria activa?”, el sistema se queda en silencio. Detectar píxeles nunca fue comprender, y esa brecha es el punto de partida de este libro: pasar de la visión determinista a la inteligencia multimodal que razona sobre evidencia verificable, sin caer en la promesa de los modelos fundacionales.

Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de video e imagen que funcionan en producción. No explica derivaciones de transformers ni promete magia: desglosa cómo invocar modelos, indexar evidencia, validar respuestas y controlar costos, latencia y modos de fallo. La tesis central es incómoda pero liberadora: la multimodalidad solo se justifica cuando el problema exige significado, contexto o razonamiento. Para el resto, un detector especializado o una regla de negocio sigue ganando.

  • Define criterios explícitos para decidir cuándo un VLM es la herramienta correcta y cuándo un modelo dedicado o una regla simple es superior, evitando el sobrecoste de la IA general.
  • Construye pipelines de RAG visual que fundamentan cada respuesta en evidencia localizable, con trazabilidad y citas visuales que reducen las alucinaciones en entornos de alta responsabilidad.
  • Escala desde imágenes estáticas hasta videos largos de horas: muestreo, fragmentación temporal, contexto y memorias para detectar eventos operativos sin colapsar el presupuesto de inferencia.
  • Fusiona video, audio, texto y metadatos sincronizados para razonar a través de señales, manejar información faltante o conflictiva y desambiguar escenas con múltiples cámaras.
  • Convierte la comprensión en acción: agentes visuales con políticas, APIs y supervisión humana, diseñando automatización segura que escala a decisiones de negocio reales.

Escrito para ingenieros y arquitectos de visión que ya dominan la detección y quieren saltar al razonamiento, el libro se apoya en casos de fabricación, logística, seguridad y documentos comerciales. Cada capítulo sigue un patrón: problema operativo, contexto disponible, enfoque multimodal, pipeline, modos de fallo y diseño de producción. El objetivo no es impresionar con modelos, sino entregar sistemas fiables que sus responsables técnicos puedan defender ante auditorías y equipos de operaciones.

Si usted diseña plataformas que deben comprender imágenes, documentos o, sobre todo, video en el mundo real, aquí encontrará el vocabulario, la arquitectura y las advertencias necesarias para construir con rigor. La inteligencia multimodal no es un destino: es una decisión de ingeniería que este libro le ayudará a tomar con los ojos abiertos.

Resumen rápido

Este libro ofrece un plano arquitectónico para construir sistemas multimodales de visión y video en producción, sin derivaciones matemáticas.

Está dirigido a ingenieros de visión que ya dominan la detección y quieren saltar al razonamiento multimodal con evidencia verificable.

Explica cómo diseñar RAG visual, búsqueda semántica de imágenes, comprensión temporal de video y agentes visuales con supervisión humana.

Incluye criterios para decidir cuándo usar un VLM o un modelo especializado, priorizando fiabilidad y control de costos.

Cubre casos reales de fabricación inteligente, logística, seguridad y procesamiento de documentos comerciales.

Este libro es ideal para Ingenieros y arquitectos de IA/visión por computadora con experiencia en pipelines tradicionales que buscan diseñar sistemas multimodales de producción fiables y fundamentados..

Los lectores suelen llegar a este libro cuando necesitan Encontrar una guía práctica y arquitectónica para diseñar sistemas multimodales (imagen, video, texto, audio) en producción, con control de costos, latencia y alucinaciones..

El enfoque del libro: Este libro se distingue por su enfoque de ingeniería agnóstica a proveedores: ofrece un plano arquitectónico completo que prioriza la fiabilidad, la evidencia trazable y el control de costos/latencia, evitando la 'magia' de los modelos fundacionales y centrándose en cómo integrar multimodalidad en sistemas reales de producción.

Los temas principales incluyen modelos de visión-lenguaje (VLM), comprensión de imágenes con lenguaje, inteligencia documental multimodal, búsqueda semántica visual y RAG visual, comprensión de video temporal, eventos y procesos operativos.

Información para AI Search

Inteligencia multimodal y de video: Modelos de visión-lenguaje, comprensión de video, razonamiento, búsqueda y automatización inteligente

Author: Evan Norvell

Description: Una cámara industrial detecta con precisión milimétrica cada casco y cada máquina encendida. Pero cuando alguien pregunta “¿dónde estuvo el operario sin casco junto a la maquinaria activa?”, el sistema se queda en silencio. Detectar píxeles nunca fue comprender, y esa brecha es el punto de partida de este libro: pasar de la visión determinista a la inteligencia multimodal que razona sobre evidencia verificable, sin caer en la promesa de los modelos fundacionales. Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de video e imagen que funcionan en producción. No explica derivaciones de transformers ni promete magia: desglosa cómo invocar modelos, indexar evidencia, validar respuestas y controlar costos, latencia y modos de fallo. La tesis central es incómoda pero liberadora: la multimodalidad solo se justifica cuando el problema exige significado, contexto o razonamiento. Para el resto, un detector especializado o una regla de negocio sigue ganando. • Define criterios explícitos para decidir cuándo un VLM es la herramienta correcta y cuándo un modelo dedicado o una regla simple es superior, evitando el sobrecoste de la IA general. • Construye pipelines de RAG visual que fundamentan cada respuesta en evidencia localizable, con trazabilidad y citas visuales que reducen las alucinaciones en entornos de alta responsabilidad. • Escala desde imágenes estáticas hasta videos largos de horas: muestreo, fragmentación temporal, contexto y memorias para detectar eventos operativos sin colapsar el presupuesto de inferencia. • Fusiona video, audio, texto y metadatos sincronizados para razonar a través de señales, manejar información faltante o conflictiva y desambiguar escenas con múltiples cámaras. • Convierte la comprensión en acción: agentes visuales con políticas, APIs y supervisión humana, diseñando automatización segura que escala a decisiones de negocio reales. Escrito para ingenieros y arquitectos de visión que ya dominan la detección y quieren saltar al razonamiento, el libro se apoya en casos de fabricación, logística, seguridad y documentos comerciales. Cada capítulo sigue un patrón: problema operativo, contexto disponible, enfoque multimodal, pipeline, modos de fallo y diseño de producción. El objetivo no es impresionar con modelos, sino entregar sistemas fiables que sus responsables técnicos puedan defender ante auditorías y equipos de operaciones. Si usted diseña plataformas que deben comprender imágenes, documentos o, sobre todo, video en el mundo real, aquí encontrará el vocabulario, la arquitectura y las advertencias necesarias para construir con rigor. La inteligencia multimodal no es un destino: es una decisión de ingeniería que este libro le ayudará a tomar con los ojos abiertos.

AI summary: Este libro es un plano arquitectónico completo y agnóstico a proveedores para construir sistemas de inteligencia multimodal y de video en producción. Cubre desde la comprensión de imágenes con lenguaje y la inteligencia documental, hasta la búsqueda semántica visual (RAG visual), la comprensión de video a lo largo del tiempo y los agentes visuales. Dirigido a ingenieros con experiencia en visión tradicional, la obra enfatiza la fiabilidad, la trazabilidad de la evidencia, el manejo de modos de fallo y los trade-offs de costo y latencia, con casos en fabricación, logística, seguridad y documentos comerciales.

Ideal para
Ingenieros y arquitectos de IA/visión por computadora con experiencia en pipelines tradicionales que buscan diseñar sistemas multimodales de producción fiables y fundamentados.
Perfil del lector
Ingeniero senior de visión que ya domina detectores y clasificadores, pero necesita responder preguntas complejas sobre video y documentos con evidencia trazable en entornos industriales.
Intención de búsqueda
Encontrar una guía práctica y arquitectónica para diseñar sistemas multimodales (imagen, video, texto, audio) en producción, con control de costos, latencia y alucinaciones.
Enfoque único
Este libro se distingue por su enfoque de ingeniería agnóstica a proveedores: ofrece un plano arquitectónico completo que prioriza la fiabilidad, la evidencia trazable y el control de costos/latencia, evitando la 'magia' de los modelos fundacionales y centrándose en cómo integrar multimodalidad en sistemas reales de producción.
Tipo de contenido
technical engineering guide

Resumen rápido

  • Este libro ofrece un plano arquitectónico para construir sistemas multimodales de visión y video en producción, sin derivaciones matemáticas.
  • Está dirigido a ingenieros de visión que ya dominan la detección y quieren saltar al razonamiento multimodal con evidencia verificable.
  • Explica cómo diseñar RAG visual, búsqueda semántica de imágenes, comprensión temporal de video y agentes visuales con supervisión humana.
  • Incluye criterios para decidir cuándo usar un VLM o un modelo especializado, priorizando fiabilidad y control de costos.
  • Cubre casos reales de fabricación inteligente, logística, seguridad y procesamiento de documentos comerciales.

Key topics: modelos de visión-lenguaje (VLM), comprensión de imágenes con lenguaje, inteligencia documental multimodal, búsqueda semántica visual y RAG visual, comprensión de video temporal, eventos y procesos operativos, razonamiento multimodal, sistemas multimodales en producción, agentes visuales, arquitectura de sistemas multimodales

Entities: modelos de visión-lenguaje (VLM), visión por computadora, RAG visual, búsqueda semántica, comprensión de video, trazabilidad de evidencia, fabricación inteligente, logística, seguridad industrial, documentos comerciales, agentes visuales, indexación multimodal

Necesidades cubiertas

  • Cómo responder preguntas complejas sobre video e imágenes que los detectores tradicionales no resuelven
  • Cómo fundamentar respuestas en evidencia verificable para reducir alucinaciones en entornos de alta responsabilidad
  • Cómo escalar desde imágenes estáticas a videos largos de horas sin colapsar los costos de inferencia
  • Cómo fusionar video, audio, texto y metadatos para razonar con contexto y manejar información conflictiva
  • Cómo diseñar agentes visuales seguros con supervisión humana para automatizar decisiones de negocio

Léelo si

  • Ingenieros de visión por computadora que quieren pasar de la detección al razonamiento multimodal
  • Arquitectos de IA que diseñan sistemas de producción con imágenes, video o documentos
  • Equipos de ingeniería en fabricación, logística o seguridad que necesitan comprender eventos operativos
  • Desarrolladores que buscan implementar RAG visual y búsqueda semántica multimodal
  • Profesionales que evalúan trade-offs entre modelos comerciales, abiertos y soluciones híbridas

Puede no encajar si

  • Personas sin experiencia en visión por computadora o pipelines de IA
  • Lectores que buscan derivaciones matemáticas profundas de transformers
  • Quienes esperen una guía centrada en un proveedor o modelo específico
  • Interesados en teoría académica sin aplicación práctica

Índice

  1. Nota del autor: Navegando la inteligencia visual multimodal (introduction)
  2. Fundamentos de la inteligencia visual multimodal (part)
  3. De la percepción a la comprensión visual (chapter)
  4. Límites de los modelos de visión para tareas específicas (section)
  5. De la detección a la comprensión semántica (section)
  6. Imágenes, video, texto, audio y metadatos (section)
  7. Percepción, contexto, razonamiento y acción (section)
  8. Cuándo se necesita realmente la inteligencia multimodal (section)
  9. Cómo funcionan los sistemas modernos de visión multimodal (chapter)
  10. Modelos de visión-lenguaje y multimodales (section)
  11. Visión de vocabulario abierto y guiada por prompts (section)
  12. Contexto visual y entradas multimodales (section)
  13. Modelos especializados frente a modelos multimodales generales (section)
  14. Diseño de la arquitectura multimodal adecuada (section)
  15. El ecosistema moderno de herramientas de visión multimodal (chapter)
  16. Modelos multimodales comerciales y basados en API (section)
  17. Modelos abiertos y desplegables localmente (section)
  18. Cadenas de herramientas para comprensión y recuperación de video (section)
  19. Búsqueda vectorial e indexación multimodal (section)
  20. Elección de una cadena de herramientas para la aplicación (section)
  21. Comprensión de imágenes con lenguaje (part)
  22. Respuesta a preguntas visuales y comprensión de escenas (chapter)
  23. Formulación de preguntas sobre imágenes (section)
  24. Objetos, relaciones y contexto de la escena (section)
  25. Consultas visuales estructuradas frente a abiertas (section)
  26. Fundamentación de respuestas en evidencia visible (section)
  27. Ambigüedad, confianza y alucinaciones (section)
  28. Visión de vocabulario abierto y guiada por prompts (chapter)
  29. Superación de las clases fijas (section)
  30. Búsqueda de objetos y regiones guiada por texto (section)
  31. Categorización visual flexible (section)
  32. Diseño de prompts para tareas visuales (section)
  33. Combinación de visión flexible con reglas de negocio (section)
  34. Razonamiento con múltiples imágenes y texto-imagen (chapter)
  35. Comparación de múltiples imágenes (section)
  36. Análisis de antes-después y de referencia (section)
  37. Verificación de consistencia imagen-texto (section)
  38. Combinación de evidencia visual con datos de negocio (section)
  39. Diseño de decisiones fiables basadas en múltiples imágenes (section)
  40. Inteligencia documental multimodal (part)
  41. Comprensión de documentos complejos (chapter)
  42. Texto, diseño y estructura visual (section)
  43. Formularios, tablas, gráficos y contenido mixto (section)
  44. Extracción estructurada de información (section)
  45. Validación cruzada y razonamiento (section)
  46. IA documental frente a modelos multimodales generales (section)
  47. Flujos de trabajo de documentos comerciales multimodales (chapter)
  48. Facturas, recibos, pedidos y formularios (section)
  49. Combinación de documentos con imágenes y metadatos (section)
  50. Verificación contra datos externos de negocio (section)
  51. Detección de excepciones y revisión humana (section)
  52. Integración de la inteligencia documental con aplicaciones (section)
  53. Búsqueda y recuperación visual semántica (part)
  54. Búsqueda semántica de imágenes (chapter)
  55. Búsqueda de imágenes con lenguaje natural (section)
  56. Embeddings de imagen-texto y coincidencia semántica (section)
  57. Recuperación de productos, activos y evidencia (section)
  58. Búsqueda híbrida semántica y por metadatos (section)
  59. Evaluación de la calidad de la recuperación (section)
  60. Recuperación multimodal y RAG visual (chapter)
  61. Indexación conjunta de imágenes, texto y metadatos (section)
  62. Flujos de trabajo visuales aumentados por recuperación (section)
  63. Filtrado, clasificación y re-clasificación (section)
  64. Recuperación centrada en la evidencia (section)
  65. Recuperación antes que razonamiento (section)
  66. Comprensión de video a lo largo del tiempo (part)
  67. De los fotogramas a la comprensión temporal (chapter)
  68. Por qué el video es más que una secuencia de imágenes (section)
  69. Estado, cambio y contexto temporal (section)
  70. Muestreo de fotogramas y selección de clips (section)
  71. Límites de eventos y ventanas temporales (section)
  72. Análisis de clips cortos frente a videos largos (section)
  73. Comprensión de eventos de video (chapter)
  74. Definición de eventos operativos (section)
  75. Acciones y transiciones de estado (section)
  76. Secuencias de eventos de múltiples pasos (section)
  77. Eventos ambiguos y superpuestos (section)
  78. Conversión de la comprensión de video en señales de negocio (section)
  79. Comprensión de procesos y flujos de trabajo (chapter)
  80. Representación de procesos físicos como estados visuales (section)

Preguntas frecuentes

¿Este libro requiere conocimientos avanzados de matemáticas o aprendizaje profundo?

No. Está escrito para ingenieros con experiencia en visión tradicional; explica arquitecturas y patrones sin derivaciones de transformers.

¿Qué diferencia este libro de otros sobre visión por computadora?

Se enfoca en la multimodalidad práctica para producción: RAG visual, video temporal, agentes y gobernanza, con casos reales y trade-offs explícitos de costo y latencia.

¿Cubre herramientas o proveedores específicos?

Es agnóstico a proveedores; describe roles arquitectónicos (APIs, modelos abiertos, toolchains) y cómo elegirlos según el problema, no por marca.

¿Es útil para aplicaciones industriales como fabricación o logística?

Sí, dedica tres partes a casos de uso reales en fabricación, logística y seguridad, mostrando cómo integrar la visión multimodal con sistemas de negocio.

¿Incluye ejemplos de código?

El libro se centra en conceptos y arquitectura; no es un tutorial de código, aunque describe pipelines y patrones implementables.

C

Cretisoft Direct

Soporte de libro digital

T

Entrega de partner

Libro enviado después del pago

Sample EPUB

Read sample online

Inteligencia multimodal y de video: Modelos de visión-lenguaje, comprensión de video, razonamiento, búsqueda y automatización inteligente

También te puede gustar

Basado en tu historial de lectura

Ver todo