Conozca Flash-KMeans: un K-Means exacto y compatible con IO que se ejecuta más de 200 veces más rápido que FAISS en GPU
k-means ha sido una herramienta fuera de línea durante décadas. Lo ejecuta una vez para preprocesar los datos y luego continúa. Un equipo de investigadores de UC Berkeley y UT…
Tutorial de NVIDIA cuTile Python: creación de núcleos de GPU en mosaico para la suma de vectores, la suma de matrices y la multiplicación de matrices en Colab
imprimir(“\n” + “=” * 90) imprimir(“ Los núcleos cuTile se definen solo si cuda.tile se importa correctamente”) print(“=” * 90) if cutile_import_ok: ConstInt = ct.Constant @ct.kernel def cutile_vec_add_direct_kernel(a, b, c,…
Xiaomi MiMo y TileRT impulsan un modelo de 1 billón de parámetros que supera los 1000 tokens por segundo en GPU comerciales
La velocidad de inferencia se está convirtiendo en una métrica competitiva para modelos de lenguaje grandes. El equipo MiMo de Xiaomi acaba de lanzar MiMo-V2.5-Pro-UltraSpeed, creado en colaboración con el…
La nueva CLI Colab de Google permite a los desarrolladores y agentes de IA ejecutar Python en GPU y TPU Colab remotas desde la terminal
Esta semana, el equipo de IA de Google lanzó la CLI de Colab. La herramienta conecta su terminal local a tiempos de ejecución remotos de Colab. Permite a los desarrolladores…
Conozca mKernel: una biblioteca de núcleo fusionado con múltiples GPU y múltiples nodos para comunicación impulsada por GPU
La sobrecarga de comunicación de la GPU es un cuello de botella mensurable en las cargas de trabajo de producción de IA. Según los datos citados por el proyecto mKernel,…
Cohere lanza Command A+: un modelo MoE disperso de 218 B para flujos de trabajo agentes que se ejecuta en tan solo dos GPU H100
Cohere acaba de lanzar Command A+, como un modelo de código abierto dirigido a flujos de trabajo agentes empresariales. Disponible bajo una licencia de Apache 2.0, Command A+ es un…
Una implementación de codificación para dominar la informática GPU con CuPy, núcleos CUDA personalizados, flujos, matrices dispersas y creación de perfiles
header(“6. RAW CUDA KERNEL — MANDELBROT”) mandel = cp.RawKernel(r”’ extern “C” __global__ void mandel(float xmin, float xmax, float ymin, float ymax, int W, int H, int max_iter, int* out) {…
NVIDIA AI acaba de lanzar cuda-oxide: un backend experimental del compilador Rust-to-CUDA que compila núcleos de GPU SIMT directamente en PTX
Paso 01 de 09 · Prerrequisitos Lo que necesita antes de comenzar cuda-oxide tiene requisitos de versión específicos para cada dependencia. Antes de instalar cualquier cosa, verifique que su sistema…