Los investigadores de inteligencia artificial han puesto el foco en uno de los grandes problemas de los actuales chatbots de IA: no basta con saber qué responde una máquina, también empieza a ser necesario averiguar qué está ocurriendo dentro de ella cuando responde.
Los investigadores de inteligencia artificial han puesto el foco en uno de los grandes problemas de los actuales chatbots de IA: no basta con saber qué responde una máquina, también empieza a ser necesario averiguar qué está ocurriendo dentro de ella cuando responde.
Con ese objetivo, un grupo de científicos de la Universidad Northeastern, en Estados Unidos, y el International Consortium for Interpretable AI (ICINAi) trabaja en el desarrollo de una especie de "detector de mentiras" para sistemas de IA capaz de identificar señales internas asociadas a comportamientos engañosos, alucinaciones y otros fallos que pueden pasar inadvertidos en una conversación normal.
Caja blanca y caja negraSegún una nota de prensa, el ICINAi es un consorcio internacional que reúne a académicos y profesionales de distintos centros para desarrollar métodos de interpretación y auditoría de los modelos de inteligencia artificial. El grupo cuenta con más de 40 investigadores y trabaja compartiendo modelos, métodos de evaluación y recursos de computación.
La idea del "detector de mentiras" no consiste en analizar el tono de una respuesta o buscar determinadas palabras, como haría una herramienta tradicional de detección de engaños. El objetivo es mucho más ambicioso: observar directamente la actividad interna de la red neuronal y localizar patrones que indiquen que el sistema está siguiendo un proceso incompatible con aquello que finalmente comunica al usuario.
ICINAi define esta aproximación como una auditoría de "caja blanca", en contraste con la habitual visión de "caja negra" de los grandes modelos de lenguaje, que hace referencia a la imposibilidad de acceder a algunos de sus procesos internos una vez que son entrenados.
Funcionamiento interno de los modelos de IAPara estudiar ese comportamiento, el equipo trabaja en el National Deep Inference Fabric, un laboratorio financiado por la National Science Foundation. Allí utiliza modelos de IA de código abierto, superordenadores y herramientas especializadas como NNsight, que permiten visualizar la actividad de las neuronas artificiales mientras el modelo procesa una pregunta y genera una respuesta.
El propósito es acercarse al funcionamiento interno de estos sistemas de una manera comparable, en cierto sentido, a cómo otras disciplinas científicas observan procesos que antes eran difíciles de medir directamente, como por ejemplo en el caso de las neurociencias y el cerebro humano.
Comprender los "secretos" de la IAEl reto es importante, porque los modelos actuales siguen siendo difíciles de interpretar. A diferencia de un programa convencional, cuyo comportamiento está definido mediante instrucciones escritas por programadores, una red neuronal aprende patrones a partir de enormes cantidades de datos y de sucesivos procesos de entrenamiento.
El resultado es un sistema capaz de realizar miles de millones de operaciones para generar una sola respuesta, pero cuyo proceso interno no siempre resulta comprensible para sus propios desarrolladores. La investigación pretende detectar precisamente esa brecha entre lo que un modelo dice y aquello que está haciendo internamente.

El equipo de investigadores estudia la actividad interna de las redes neuronales para identificar patrones asociados a engaños, alucinaciones y respuestas poco fiables. / Crédito: Felix Martinez en Pixabay.
Temas sensiblesEn concreto, el objetivo es desarrollar métodos capaces de identificar no solo engaños, sino también objetivos ocultos, censura, alucinaciones y otros fallos que las evaluaciones convencionales pueden no descubrir. Sin dudas, esto es clave a medida que los chatbots se utilizan en ámbitos sensibles.
Es el caso de las consultas médicas, en las que una respuesta incorrecta podría inducir a una persona a tomar una decisión equivocada. Los investigadores advierten que la dependencia de estos sistemas aumenta también en cuestiones financieras, laborales o relacionadas con decisiones personales.
Una disciplina sistemáticaEn definitiva, el objetivo del proyecto es identificar mecanismos internos asociados a distintos tipos de comportamiento no fiable o engañoso. ICINAi plantea investigar fenómenos como la decepción, las explicaciones no fieles y los objetivos ocultos desde una perspectiva experimental.
Los científicos ya han empezado a recopilar datos sobre comportamientos como la tendencia de algunos modelos a mostrarse excesivamente complacientes al responder preguntas médicas. La idea de fondo es convertir estos experimentos en una disciplina más sistemática, con métricas, protocolos y recursos compartidos.
Fuente: Levante - EMV
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Creen un «detector de mentides» per controlar les respostes dels xatbots d’IA | 0 | 7.49 | 07-10-2026 |
| 2 | Can scientists build a lie detector for AI chatbots? | 0 | 6.94 | 06-10-2026 |
| 3 | Un peligro oculto de ChatGPT está destruyendo matrimonios y provocando divorcios en todo el mundo | 0 | 5.86 | 02-10-2026 |
| 4 | La Inteligencia Artificial no nos parece tan consciente como los humanos | 0 | 6.14 | 07-10-2026 |
| 5 | Remedios | 0 | 10 | 01-10-2026 |
| 6 | Seguir el ritmo de la IA en 2026 es imposible: el reto de descubrir cuál es el mejor chatbot a día de hoy | 0 | 7.52 | 29-09-2026 |
| 7 | ¿Puede la IA salvar a los turistas de la multitud de TikTok? | 0 | 5.52 | 23-08-2026 |
| 8 | ¿Puede la IA salvar a los turistas de la multitud de TikTok? | 0 | 5.52 | 23-08-2026 |
| 9 | La inteligencia artificial impulsa el fraude en la automoción | 0 | 7.51 | 28-09-2026 |
| 10 | Ataques en enjambre y estafas de 'phishing': los incidentes donde la IA actuó fuera de control | 0 | 6.94 | 14-09-2026 |