Un gran modelo de lenguaje tuvo que enfrentarse a las limitaciones físicas del hardware real.

El principal obstáculo para realizar cálculos directamente en la memoria no fue la falta de potencia, sino el ruido de las propias celdas, que hacía que las redes neuronales perdieran precisión rápidamente. Un equipo de Hong Kong y Shenzhen presentó el método BSQ, que adapta modelos ya entrenados a la física de los memristores y reduce las pérdidas sin reentrenamiento.
En un ordenador convencional el procesador transfiere constantemente los parámetros del modelo desde la memoria, realiza las operaciones y devuelve los resultados. El cómputo en memoria (CIM) elimina parte de ese intercambio. Una matriz de memristores almacena los pesos y, a la vez, realiza operaciones vector-matriz que son la base de las redes neuronales. Este enfoque reduce la latencia y potencialmente ahorra energía.
El problema surge al pasar de la matemática ideal a la electrónica analógica. La conductancia de los memristores no se puede fijar con absoluta exactitud y el valor grabado varía ligeramente por fluctuaciones físicas. Con baja resolución, los errores de celdas individuales se acumulan a lo largo de las capas del modelo. En redes profundas ese ruido de hardware puede deteriorar notablemente el resultado.
BSQ divide cada peso de la red neuronal en varias capas binarias, donde cada celda necesita solo dos estados estables. Las capas individuales reciben coeficientes entrenables y el circuito periférico suma sus contribuciones y reconstruye un valor más preciso. En lugar de intentar que el memristor almacene de forma fiable múltiples niveles de conductancia, el algoritmo utiliza los estados simples de encendido y apagado.
Además, el método tiene en cuenta la distribución de los pesos iniciales y selecciona niveles de cuantización de forma no uniforme. Durante la preparación se introduce en las capas binarias ruido correspondiente a las características medidas de las celdas físicas. Este enfoque hardware‑software ya ayudó a compensar los defectos de matrices de memristores, pero BSQ está dirigido específicamente al despliegue de baja resolución de redes neuronales convencionales.
En el reconocimiento de dígitos manuscritos, el modelo BSQ de dos bits mantuvo una precisión del 98,2% con una variación de conductancia del 5%. La cuantización uniforme convencional en las mismas condiciones mostró 82,2%. Incluso con un ruido mucho mayor con σ = 0,30, el resultado de BSQ cayó solo aproximadamente de 98,28% a 95,75%, mientras que la brecha con el método tradicional siguió siendo amplia.
En la tarea de análisis de sentimiento la ventaja fue más modesta. TextCNN de tres bits en el conjunto SST-2 alcanzó 80,6% con una variación simulada del 5% frente a 80,1% con la cuantización convencional. La versión completa mostraba 81,08%. Para los autores este resultado es importante sobre todo como confirmación de que la ganancia se mantiene no solo en el reconocimiento simple de imágenes.
La diferencia más notable se obtuvo en LLaMA-3.1-8B. En modo de tres bits con ruido de hardware simulado, BSQ logró 55,36% en HellaSwag frente al 35,28% de GPTQ. La brecha fue de 20,08 puntos porcentuales. En modo de dos bits, las ventajas en pruebas aisladas fueron aún mayores, y BSQ seguía produciendo resultados correctos donde el método comparativo se volvía inestable.
Los resultados con el gran modelo de lenguaje por ahora se refieren precisamente a la simulación de ruido de hardware, no a la ejecución de toda la LLaMA-3.1-8B en una matriz de memristores. Los autores calibraron los parámetros de la simulación mediante mediciones de equipo real. Para la parte de hardware, el equipo fabricó un arreglo cruzado 512 × 512 con un proceso de 40 nm y celdas resistivas basadas en óxido de tántalo.
BSQ funciona después del entrenamiento del modelo, por lo que no es necesario volver a entrenar una red de miles de millones de parámetros para un arreglo concreto. En caso de una escalabilidad posterior, este enfoque puede acercar las redes neuronales a dispositivos donde el almacenamiento de parámetros y las operaciones matriciales principales ocurren en un mismo bloque. Cálculos directamente en memoria similares ya se están probando para la IA en el borde, donde el consumo energético y la latencia son críticos.