Navegación

Ejecutando Kimi K3 en C: Inferencia de IA local en 8 GB de RAM

fuente: https://securityonline.info/kimi-k3-in-c/

El desarrollador FareedKhan se propuso recientemente ejecutar el formidable modelo Kimi K3 en hardware de consumo. Normalmente, ejecutar un modelo de esta magnitud localmente resulta completamente imposible para dispositivos estándar. Sin embargo, el desarrollador diseñó un motor de inferencia C99 puro para lograr la ejecución local. En su máximo rendimiento, el sistema procesa la salida a 20 segundos por token. Por el contrario, con una memoria restringida de 8 GB, la velocidad se reduce a 33 segundos por token.

El pilar central de este proyecto consiste en ejecutar la inferencia para Kimi K3 en una sola CPU y 8 GB de RAM. Fundamentalmente, el sistema funciona sin depender de GPU, marcos de aprendizaje profundo ni bibliotecas BLAS. Si bien el proyecto no busca una implementación práctica de alta velocidad, cumple un propósito fundamental. Ilumina la arquitectura Mixture-of-Experts (MoE) de Kimi K3 y demuestra la viabilidad de ejecutar modelos masivos en dispositivos con memoria limitada.

Últimas noticias

29 DE JUNIO, 2026

Mustang Panda ocultó el C2 en el tráfico de la nube.

Acronis afirma que el grupo vinculado a China utilizó Zoho WorkDrive como canal de comandos en campañas contra el gobierno indio y objetivos relacionados con la...

Leer artículo
29 DE JUNIO, 2026

EvilTokens oculta el riesgo de robo de cuentas a su SOC.

El análisis de URL estáticas no lo detecta, ya que la página de phishing solo aparece después del descifrado del navegador. Evite lagunas de visibilidad y acele...

Leer artículo
29 DE JUNIO, 2026

Los hackers ahora explotan una vulnerabilidad crítica de Oracle E-Business en ataques.

Según la empresa de inteligencia de amenazas Defused, los atacantes han comenzado a explotar una vulnerabilidad crítica (identificada como CVE-2026-46817) en la...

Leer artículo