Mostrando entradas con la etiqueta LLM. Mostrar todas las entradas
Mostrando entradas con la etiqueta LLM. Mostrar todas las entradas

martes, 21 de enero de 2025

ChatBots y Modelos de LLM

 

Chatbots

Inicialmente surgieron para brindar servicios de atención al cliente:
  • Zendesk Chat
  • Intercom
  • Drift

Frameworks para armar chatbots más personalizados:
  • Rasa: Open-source y personalizable.
  • Microsoft Bot Framework: Para integrar con Azure y otras plataformas.
  • Dialogflow: Plataforma de Google Cloud para crear chatbots basados en IA.
  •  

    Modelos de LLM :

    • Modelos de OpenAI (GPT-4, GPT-3.5, etc.): Disponibles a través de APIs comerciales.
    • Hugging Face Transformers: Modelos open-source como BERT, GPT-Neo, LLaMA o Falcon que puedes entrenar o afinar localmente.
    • Google Vertex AI: Ofrece acceso a modelos de PaLM y otros.
    • Azure OpenAI Service: Acceso a modelos de OpenAI con integración empresarial.
    • Anthropic Claude: Otra opción para modelos de lenguaje avanzados.

    Para estructurar datos:
    • Pipelines ETL: Extraer, transformar y cargar datos (Apache Spark, Pandas).
    • Herramientas de indexación: para convertir los datos en un formato accesible.
      • LangChain: Para conectar datos y LLMs de manera estructurada.
      • Haystack: Framework para construir pipelines de NLP basados en búsqueda.
      • Pinecone, Weaviate, o Milvus: Bases de datos vectoriales para búsquedas semánticas.

    Asistentes de voz:
    Las herramientas tienen costos asociados por minuto de uso.
    • Retell: el mejor para idioma español, con menos latencia y más económico.
    • Synthflow: soporta modelos de lenguaje LLM. Permite enviar SMS, hacer real time booking y ofrece integración nativa con GoHighLevel, Zapier y otros.
    • Bland.AI
    • Vapi
    • Air
    Normalmente utilizan Twillio para realizar llamadas por teléfono.

      lunes, 20 de enero de 2025

      Asistentes y Aplicaciones de IA Varios

      A continuación mencionamos las aplicacioens de IA más conocidas hasta el momento. 

      A medida que avanzamos en el análisis de algunas categorías, se nos hace necesario crear nuevas entradas en el blog para poder volcar más información. Este es el caso de:

      - Automatización y Agentes de IA
      - IA para Planificación de Viajes
      - IA aplicada a la Construcción
      - ChatBots y Modelos de LLM/RAG


      Asistentes Personales y Compañeros Digitales

      Suelen responder preguntas, administrar calendarios, controlar dispositivos inteligentes. 

      Las más conocidas son las que vienen incorporadas en los celulares y sistemas operativos:

      • Siri
      • Alexa
      • Google Assistant
      Compañeros digitales más avanzados son:
      • Character.AI: Diseña compañeros virtuales. Ideal para entretenimiento y simulaciones específicas.
      • Replika: permite generar un Avatar, un amigo virtual que ayuda con apoyo emocional y social. Ofrece conversaciones relajadas, ejercicios de bienestar, y escucha activa.
      • Woebot: Terapeuta virtual basado en IA para mejorar la salud mental.

      Suplantación de Identidad

      Deepfakes (video e imágenes): crear videos falsos en los que alguien parece decir o hacer algo que nunca ocurrió.
      Voice Synthesis: replicar patrones vocales a partir de grabaciones existentes.
      Text Spoofing: imitar el estilo de escritura de una persona.
      Image Spoofing: manipular o crear de imágenes realistas con IA.

      Herramientas para clonarte en video:
      • Synthesia: Permite crear un avatar digital a partir de tu imagen y voz para generar videos con texto como entrada.
      • Avatarify: Software de código abierto que te permite controlar un avatar en tiempo real usando tus expresiones faciales.
      • DeepBrain AI: Crea un avatar hiperrealista a partir de un video tuyo, que luego puedes usar para generar contenido con texto o guiones.
      • HeyGen (antes Movio): Permite crear videos con avatares personalizados que incluyen movimientos faciales y sincronización de labios.
      • D-ID: Ofrece la posibilidad de crear videos a partir de una foto estática de ti mismo combinada con texto o audio.


      Herramientas para clonarte tu voz:

      • ElevenLabs: Clona tu voz con alta precisión para generar audios personalizados.
      • Respeecher: Genera una clonación perfecta de tu voz para contenido creativo.


        Procesamiento de Lenguaje Natural (NLP)

        Análisis de texto, generación de contenido, corrección gramatical.
        • Grammarly
        • Jasper
        • Copy.ai

        Análisis de Datos e Inteligencia de Negocios

        Visualización de datos, generación de reportes, consultas en lenguaje natural.
        • Tableau con Ask Data
        • ThoughtSpot.

        Educación y Aprendizaje

        Personalización del aprendizaje, generación de ejercicios, retroalimentación.
        • Duolingo
        • Khan Academy con AI
        • Quizlet

        Creación de Imágenes

        Crear ilustraciones, gráficos, renders, o imágenes a partir de texto.
        • DALL·E
        • MidJourney
        • Stable Diffusion
        • ChatGPT Plus (se conecta con DALL-E): Puedes describir con palabras lo que necesitas y DALL·E creará una imagen basada en esa descripción.

        Creación de Audio

        Composición de música, creación de narraciones, síntesis de voz.
        • Hailuo AI Audio: Speech Synthesis. Excelente generación de voz a partir de textos. Tiene una gran cantidad de tipos de voces e idiomas. Se puede agregar "emosión" y cambiar la velocidad de la narración. Excelente!
        • Descript
        • AIVA
        • Murf.ai.

        Generación de Textos

        Escritura de artículos, copywriting, generación de diálogos o guiones, traducciones.
        • ChatGPT: El más utilizado y primero en salir al mercado.
        • Hailuo AI Chat: ¿Le pisa los talones o supera a ChatGPT? Hay que probarlo. Soporta mucho más contexto (4M) y está enfocado en la interacción emocional y la comprensión del contexto humano. Apoyo emocional y consejos.
        • IBM Watson Assistant: Atención al cliente, soporte técnico, integración con sistemas empresariales.
        • Jasper: Generación de contenido, redacción de textos publicitarios, creación de contenido para redes sociales.
        • Copy.ai: Generación de texto, redacción de correos electrónicos, creación de contenido para marketing.

        Generación de Video


        Edición de video asistida, creación de videos a partir de texto, deepfake.
        • Hailuo Video: Impresionante generador de video a partir de texto, a partir de una imagen y generación de personajes dentro de una escena.
        • Runway
        • Synthesia
        • Pictory

        Generación de Modelos 3D

        Creación de modelos 3D a partir de imágenes o descripciones.

        • NVIDIA Omniverse
        • Kaedim

        Edición y Mejora Creativa

        Mejora automática de fotos, sugerencias de diseño, ajustes asistidos.
        • Canva con Magic Write
        • Adobe Sensei.

        Generación Multimodal (Texto a Imagen, Audio, Video, etc.)

        Transformar texto en múltiples formatos creativos como imágenes, videos o audios.

        • Runway Gen-2
        • Hugging Face (text-to-image models)

        Analizar Videos y Resumir Ideas

        • Otter.ai: Transcribe automáticamente el audio de un video y utiliza NLP para generar resúmenes de las ideas principales. Ideal para reuniones o conferencias. Compatible con Zoom, Google Meet y videos subidos directamente.
        • Derscript: Transcripción automática y edición basada en texto; permite identificar ideas clave y eliminar fragmentos irrelevantes. Integra edición de video y herramientas de resumen.
        • Trint: Transcribe videos y genera resúmenes o puntos clave. También permite la edición colaborativa del contenido transcrito. Muy útil para periodistas y creadores de contenido.
        • Wisecut: Transcribe y genera resúmenes automáticos de videos largos, eliminando silencios y pausas. Fácil de usar, especialmente para ediciones rápidas.
        • Rephrase.ai: Utiliza inteligencia artificial para resumir ideas clave de videos. También puede convertir texto en videos personalizados. Compatible con varios idiomas y plataformas.
        • Video Insights de IBM Watson Media:  Extrae automáticamente resúmenes e ideas clave de contenido de video mediante análisis de lenguaje y reconocimiento de imágenes. Potente herramienta empresarial con análisis avanzado.
        • InVideo: Transcribe audio de video y permite resaltar y extraer puntos clave. Incluye opciones de edición adicional y mejora visual.
        • Microsoft Stream: Genera transcripciones automáticas de videos y permite buscar palabras clave dentro del contenido transcrito. Integrado en la suite de Microsoft 365, útil para uso corporativo.

        Aplicaciones de Salud

        Diagnósticos iniciales, terapia conversacional, seguimiento de salud.
        • Ada Health
        • Woebot
        • Babylon Health

        Gaming e IA Narrativa
        Generación de historias, personajes interactivos.
        • AI Dungeon
        • Replica.

        Gestión y Productividad

        Resúmenes automáticos, toma de notas, planificación.
        • Notion AI
        • Otter.ai: Transcribe automáticamente el audio de un video y utiliza NLP para generar resúmenes de las ideas principales. Ideal para reuniones o conferencias.
        • 15minuteplan.ai: Genera planes de negocio.

        E-commerce y Recomendaciones

        Personalización de productos, chatbots para ventas.
        • Shopify con AI
        • Amazon Personalize

        Otras Aplicaciones

        En esta categoría entran algunas Apps recomendadas fuera de serie.

        • Simple Sing: My Singing App - Adapta cualquier cansión a tu tono de voz para poder cantarla sin problemas.

        Plataformas

        Estas son las plataformas más conocidas que ofrecen generación de imágenes mediante inteligencia artificial, organizadas por su popularidad y enfoque:

        MidJourney
        • Descripción: Plataforma muy reconocida por su capacidad para crear imágenes artísticas y visualmente impresionantes a partir de texto.
        • Acceso: Funciona principalmente a través de Discord.
        • Usos Destacados: Arte conceptual, diseño gráfico, creación de portadas de libros.
        DALL·E 2 (de OpenAI)
        • Descripción: Creado por OpenAI, genera imágenes detalladas a partir de texto y permite edición en las imágenes generadas.
        • Acceso: Directamente desde OpenAI o a través de la integración con ChatGPT Plus.
        • Usos Destacados: Imágenes conceptuales, ilustraciones personalizadas.
        Stable Diffusion
        • Descripción: Una plataforma de código abierto para generación de imágenes, que permite personalizaciones avanzadas.
        • Acceso: A través de interfaces como DreamStudio, Automatic1111 o aplicaciones independientes.
        • Usos Destacados: Creación de imágenes únicas, diseño técnico, experimentación.
        Runway ML
        • Descripción: Plataforma multimodal que no solo genera imágenes, sino también videos, permitiendo edición y creación avanzada.
        • Acceso: Basado en navegador; ideal para creadores multimedia.
        • Usos Destacados: Generación de videos, prototipos creativos, efectos visuales.
        Artbreeder
        • Descripción: Especializado en modificar y generar retratos o imágenes estilizadas mediante IA.
        • Acceso: Plataforma en línea con herramientas simples para usuarios principiantes.
        • Usos Destacados: Diseño de personajes, retratos, arte conceptual.
        DeepAI
        • Descripción: Proporciona herramientas básicas para la generación de imágenes, enfocándose en simplicidad y resultados rápidos.
        • Acceso: Basado en navegador; ideal para uso casual.
        • Usos Destacados: Generación rápida de conceptos, bocetos básicos.
        NightCafe Studio
        • Descripción: Enfocado en la creación de obras de arte mediante diferentes algoritmos de IA.
        • Acceso: Plataforma en línea con opciones gratuitas y de pago.
        • Usos Destacados: Arte digital, murales, diseño decorativo.
        Fotor (AI Art Generator)
        • Descripción: Herramienta simple y amigable para usuarios no técnicos, con un enfoque en diseño y marketing.
        • Acceso: En línea y como app móvil.
        • Usos Destacados: Publicidad, diseño gráfico rápido.
        Craiyon (antes DALL·E Mini)
        • Descripción: Versión simplificada de DALL·E, accesible y gratuita, aunque con resultados más básicos.
        • Acceso: Basado en navegador.
        • Usos Destacados: Experimentación casual.

        Factores para Elegir una Plataforma

        • Calidad de las imágenes: MidJourney y DALL·E destacan por su realismo y creatividad.
        • Facilidad de uso: NightCafe y Fotor son ideales para principiantes.
        • Costo: Stable Diffusion (gratuito en local) y Craiyon son opciones económicas.
        • Flexibilidad: Stable Diffusion y Runway ML son muy personalizables.


        viernes, 29 de noviembre de 2024

        Reconocimiento de placas de automobiles

        ¿Qué es el reconocimiento de placas de licencia?

        ANPR (Automatic number plate recognition) o Automatic license plate recognition (ALPR) son las siglas en ingles del reconocimiento automático de patentes, que básicamente consiste en la extracción de información de la patente del vehículo a partir de una imagen o una secuencia de imágenes. 

        El reconocimiento de placas de licencia, también conocido como reconocimiento automático de placas de licencia (RALP), es una tecnología que utiliza algoritmos de procesamiento de imágenes y aprendizaje automático para identificar y reconocer automáticamente los números de las placas de licencia de los vehículos. Esta tecnología se basa en la captura de imágenes de las placas de licencia a través de cámaras y el análisis de estas imágenes para extraer los caracteres alfanuméricos que componen los números de las placas.

        Palabras claves

        ANPR (Automatic number plate recognition) o Automatic license plate recognition (ALPR) son las siglas en ingles del reconocimiento aut omático de patentes, que básicamente consiste en la extracción de información de la patente del vehículo a partir de una imagen o una secuencia de imágenes. 

        Tecnología utilizada en el reconocimiento de placas de licencia

        Procesamiento de imágenes

        Para llevar a cabo el reconocimiento de placas de licencia, se utiliza el procesamiento de imágenes. Este proceso implica la captura de imágenes de Alta resolución de las placas de licencia a través de cámaras especializadas. A continuación, se aplican algoritmos de procesamiento de imágenes para mejorar la calidad de las imágenes, corregir distorsiones y extraer los caracteres alfanuméricos de las placas.

        Aprendizaje automático y redes neuronales

        Además del procesamiento de imágenes, el reconocimiento de placas de licencia también hace uso de técnicas de aprendizaje automático y redes neuronales. Estas técnicas permiten entrenar algoritmos para reconocer y clasificar los caracteres de las placas de licencia, mejorando así la precisión y la capacidad de adaptación del sistema a diferentes situaciones y condiciones de captura de imágenes.

        Principales modelos

        YOLO (You Only Look Once)
        • Características: YOLO es un modelo de detección de objetos en tiempo real. Es muy eficiente para detectar y delimitar objetos como patentes en imágenes o videos.
        • Preentrenado: Está entrenado con el dataset COCO (Common Objects in Context), que incluye automóviles y otros objetos, pero puedes entrenarlo específicamente para detectar placas.
        • Implementación:
          Necesitarás crear un dataset anotado con las placas de autos.
          Puedes usar herramientas como LabelImg para etiquetar placas en imágenes.
        Faster R-CNN
        • Características: Modelo robusto para detección de objetos con precisión alta, aunque no es tan rápido como YOLO.
        • Preentrenado: Utiliza datasets genéricos como COCO o Pascal VOC.
        • Ventaja: Fácil de ajustar a la tarea específica de detección de placas.
        Detectron2 (de Facebook AI)
        • Características: Plataforma de detección de objetos de última generación basada en Faster R-CNN, Mask R-CNN y otros modelos avanzados.
        • Preentrenado: Puedes comenzar con un modelo base y realizar transfer learning con tu dataset de patentes.
        EAST (Efficient and Accurate Scene Text Detector)
        • Características: Especializado en la detección de texto en imágenes.
        • Preentrenado: Muy utilizado como paso previo al OCR. Puedes usarlo para identificar áreas de texto (como placas) y luego aplicar un modelo OCR.
        CRNN (Convolutional Recurrent Neural Network)
        • Características: Ideal para tareas OCR después de detectar la región de interés (ROI) de las placas con un detector de objetos.
        • Preentrenado: Hay modelos disponibles entrenados en texto en ambientes diversos.

        ¿Cómo funciona el reconocimiento de placas de licencia?

        El funcionamiento del reconocimiento de placas de licencia consta de varios pasos principales. En primer lugar, las cámaras capturan imágenes de las placas de licencia de los vehículos. Luego, estas imágenes son procesadas mediante algoritmos de extracción de características para identificar y aislar los caracteres alfanuméricos de las placas. A continuación, se utilizan algoritmos de reconocimiento de patrones y aprendizaje automático para clasificar y reconocer los caracteres y formar las secuencias de números y letras que componen los números de las placas. Finalmente, se realiza la verificación y validación de los resultados obtenidos, y se generan informes o se toman acciones dependiendo de la aplicación específica del sistema de reconocimiento.

        Repositorios y proyectos

        Como referencia sabemos que la solución implementada en autopistas y CNSI tiene una efectividad del 96% (sobre 56 casos tomados).

        License Plate Recognizer (Argentina)

        Modelo basado en Python + OCR. Utiliza OpenCV para preprocesar imágenes y detectar regiones donde se encuentran las matrículas mediante técnicas como la binarización y la detección de bordes y Tesseract OCR, una herramienta de código abierto, para extraer el texto de las matrículas una vez que son segmentadas de las imágenes

        Resultado: localizar patentes: 8%  Efectividad total 0%. Sólo funciona bien con las imágenes propias del proyecto.

        Automatic Number Plate Recognition Proof of Concept with Azure Cognitive Services

        Utiliza Azure Cognitive Services para reconocimiento de patentes.
        Resultado: no se pudo probar todavía x falta de permisos de acceso a los servicios.

        Reconocimientos Automático de Matrículas ANPR

        TP de un alumno de  Ingeniería en Electrónica. Están muy bien aplicados los conceptos básicos sobre acondicionamiento y transformaciones de imágenes (smoothing, averaging, median blurring, erode y dilate).


        SimpleLPR - .NET

        Componente publicado en Nuget. En la página de Warelogic se publica un costo por única vez de $450.
        Resultado: localizar patentes: 98%. Efectividad total 82%.

        License plate recognition using CNN

        Jupiter Notebook (Python) que utiliza deep learning (CNN - Convolucional Neural Network) para la detección de patentes. Utiliza OpenCV, TensorFlow, Keras y bibliotecas de Python (Sklearn).
        Está optimizado para patentes de la India.
        La ventaja de este proyecto es que se puede reentrenar.
        Resultado: localizar patentes: 53%. Efectividad total 0%.

        OpenALPR es una biblioteca de código abierto para el reconocimiento automático de matrículas escrita en C++ con enlaces en C#, Java, Node.js, Go y Python. La biblioteca analiza imágenes y secuencias de vídeo para identificar matrículas. El resultado es la representación de texto de cualquier carácter de la matrícula.
        Actualmente no cuenta con reconocimientos de patentes de Argentina. Se hicieron pruebas con varioas regiones.
        Resultado: localizar patentes: 63%. Efectividad total 25%.

        Conclusiones

        Metricas de los 3 proyectos (sobre un total de 100 casos)

        Más allá del tratamiento de imágenes para reconocer las patentes está el desarrollo de la solución que toma las imágens de la cámara de video, que debe permitir definir regiones y generar la salida para el tratamiento de cada imagen y luego guardar el resultado de las capturas realizadas.
        Esta solución debería dar la posibilidad de obtener la última patente registrada en un puesto de control a un momento determinado.

        viernes, 18 de octubre de 2024

        Ejemplo de personalización de Modelos de Lenguaje (LM) con RAG

         El siguiente es un ejemplo de modelo de lenguaje personalizado con RAG (Retrieval Aumented Generation)

        Proyecto: eShopSupport

        Video: https://reactor.microsoft.com/es-es/reactor/events/23333/ 

        Soporta los siguientes casos de uso: 

        • Text classification, applying labels based on content
        • Sentiment analysis based on message content
        • Summarization of large sets of text
        • Synthetic data generation, creating test content for the sample
        • Chat bot interactions with chat history and suggested responses

        De este proyecto se desprenden las siguientes herramientas y técnicas:

        - .Net Aspire: es una herramienta completa para el diagnóstico y la supervisión de aplicaciones. El panel permite realizar un seguimiento estrecho de varios aspectos de la aplicación, incluidos registros, seguimientos y configuraciones de entorno, en tiempo real.

        - Redis: plataforma de bases de datos en tiempo real. Redis es un motor de base de datos en memoria, basado en el almacenamiento en tablas de hashes pero que opcionalmente puede ser usada como una base de datos durable o persistente.