NVIDIA lanza Nemotron 3 Super: un modelo MoE híbrido de atención Mamba de código abierto y parámetros de 120 B que ofrece un rendimiento 5 veces mayor para IA agente
La brecha entre los modelos fronterizos propietarios y los modelos de código abierto altamente transparentes se está cerrando más rápido que nunca. NVIDIA ha levantado oficialmente el telón de Nemotron…
NVIDIA AI lanza Nemotron 3: una pila MoE híbrida de Mamba Transformer para IA agente de contexto prolongado
NVIDIA ha lanzado la familia Nemotron 3 de modelos abiertos como parte de una pila completa para IA agente, que incluye pesos de modelos, conjuntos de datos y herramientas de…
Los investigadores de Tencent AI introducen Hunyuan-T1: un modelo de lenguaje ultra grande alimentado por mamba que redefine un razonamiento profundo, eficiencia contextual y aprendizaje de refuerzo centrado en el ser humano
Los modelos de idiomas grandes luchan para procesar y razonar sobre textos largos y complejos sin perder un contexto esencial. Los modelos tradicionales a menudo sufren pérdida de contexto, manejo…
Este artículo de IA presenta BEST-STD (detección de términos hablados): un novedoso marco de tokenización de voz bidireccional mejorado con Mamba para una detección eficiente de términos hablados
La detección de términos hablados (STD) es un área crítica en el procesamiento del habla, que permite la identificación de frases o términos específicos en grandes archivos de audio. Esta…
Investigadores de MBZUAI y CMU presentan Bi-Mamba: una arquitectura Mamba de 1 bit escalable y eficiente diseñada para modelos de lenguaje grandes en múltiples tamaños (parámetros 780M, 1.3B y 2.7B)
La evolución del aprendizaje automático ha traído avances significativos en los modelos de lenguaje, que son fundamentales para tareas como la generación de texto y la respuesta a preguntas. Entre…
Vision Mamba: como un Vision Transformer, pero mejor | por Sascha Kirch | Sep, 2024
Esta es la parte 4 de mi nueva serie de varias partes. 🐍 Hacia los modelos espaciales de estados Mamba para imágenes, vídeos y series temporales. yoEl campo de la…
AiM: un modelo generativo de imágenes autorregresivo (AR) basado en la arquitectura Mamba
Los modelos de lenguaje de gran tamaño (LLM) basados en arquitecturas de decodificadores de transformadores autorregresivos han avanzado en el procesamiento del lenguaje natural con un rendimiento y una escalabilidad…
Mamba Retriever: un modelo de recuperación de información para utilizar Mamba para una recuperación densa eficaz y eficiente
Los modelos de recuperación densa (DR) son un método avanzado de recuperación de información (IR) que utiliza técnicas de aprendizaje profundo para mapear pasajes y consultas en un espacio de…