Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Crean un "detector de mentiras" para controlar las respuestas de los chatbots de IA

Дата публикации: 07-10-2026 13:37:42

Los investigadores de inteligencia artificial han puesto el foco en uno de los grandes problemas de los actuales chatbots de IA: no basta con saber qué responde una máquina, también empieza a ser necesario averiguar qué está ocurriendo dentro de ella cuando responde.

Основное содержимое страницы с новостью.

Los investigadores de inteligencia artificial han puesto el foco en uno de los grandes problemas de los actuales chatbots de IA: no basta con saber qué responde una máquina, también empieza a ser necesario averiguar qué está ocurriendo dentro de ella cuando responde.

Con ese objetivo, un grupo de científicos de la Universidad Northeastern, en Estados Unidos, y el International Consortium for Interpretable AI (ICINAi) trabaja en el desarrollo de una especie de "detector de mentiras" para sistemas de IA capaz de identificar señales internas asociadas a comportamientos engañosos, alucinaciones y otros fallos que pueden pasar inadvertidos en una conversación normal.

Caja blanca y caja negra

Según una nota de prensa, el ICINAi es un consorcio internacional que reúne a académicos y profesionales de distintos centros para desarrollar métodos de interpretación y auditoría de los modelos de inteligencia artificial. El grupo cuenta con más de 40 investigadores y trabaja compartiendo modelos, métodos de evaluación y recursos de computación.

La idea del "detector de mentiras" no consiste en analizar el tono de una respuesta o buscar determinadas palabras, como haría una herramienta tradicional de detección de engaños. El objetivo es mucho más ambicioso: observar directamente la actividad interna de la red neuronal y localizar patrones que indiquen que el sistema está siguiendo un proceso incompatible con aquello que finalmente comunica al usuario.

ICINAi define esta aproximación como una auditoría de "caja blanca", en contraste con la habitual visión de "caja negra" de los grandes modelos de lenguaje, que hace referencia a la imposibilidad de acceder a algunos de sus procesos internos una vez que son entrenados.

Funcionamiento interno de los modelos de IA

Para estudiar ese comportamiento, el equipo trabaja en el National Deep Inference Fabric, un laboratorio financiado por la National Science Foundation. Allí utiliza modelos de IA de código abierto, superordenadores y herramientas especializadas como NNsight, que permiten visualizar la actividad de las neuronas artificiales mientras el modelo procesa una pregunta y genera una respuesta.

El propósito es acercarse al funcionamiento interno de estos sistemas de una manera comparable, en cierto sentido, a cómo otras disciplinas científicas observan procesos que antes eran difíciles de medir directamente, como por ejemplo en el caso de las neurociencias y el cerebro humano.

Comprender los "secretos" de la IA

El reto es importante, porque los modelos actuales siguen siendo difíciles de interpretar. A diferencia de un programa convencional, cuyo comportamiento está definido mediante instrucciones escritas por programadores, una red neuronal aprende patrones a partir de enormes cantidades de datos y de sucesivos procesos de entrenamiento.

El resultado es un sistema capaz de realizar miles de millones de operaciones para generar una sola respuesta, pero cuyo proceso interno no siempre resulta comprensible para sus propios desarrolladores. La investigación pretende detectar precisamente esa brecha entre lo que un modelo dice y aquello que está haciendo internamente.

El equipo de investigadores estudia la actividad interna de las redes neuronales para identificar patrones asociados a engaños, alucinaciones y respuestas poco fiables.

El equipo de investigadores estudia la actividad interna de las redes neuronales para identificar patrones asociados a engaños, alucinaciones y respuestas poco fiables. / Crédito: Felix Martinez en Pixabay.

Temas sensibles

En concreto, el objetivo es desarrollar métodos capaces de identificar no solo engaños, sino también objetivos ocultos, censura, alucinaciones y otros fallos que las evaluaciones convencionales pueden no descubrir. Sin dudas, esto es clave a medida que los chatbots se utilizan en ámbitos sensibles.

Es el caso de las consultas médicas, en las que una respuesta incorrecta podría inducir a una persona a tomar una decisión equivocada. Los investigadores advierten que la dependencia de estos sistemas aumenta también en cuestiones financieras, laborales o relacionadas con decisiones personales.

Una disciplina sistemática

En definitiva, el objetivo del proyecto es identificar mecanismos internos asociados a distintos tipos de comportamiento no fiable o engañoso. ICINAi plantea investigar fenómenos como la decepción, las explicaciones no fieles y los objetivos ocultos desde una perspectiva experimental.

Los científicos ya han empezado a recopilar datos sobre comportamientos como la tendencia de algunos modelos a mostrarse excesivamente complacientes al responder preguntas médicas. La idea de fondo es convertir estos experimentos en una disciplina más sistemática, con métricas, protocolos y recursos compartidos.

Fuente: Levante - EMV

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Creen un «detector de mentides» per controlar les respostes dels xatbots d’IA07.4907-10-2026
2Can scientists build a lie detector for AI chatbots?06.9406-10-2026
3Un peligro oculto de ChatGPT está destruyendo matrimonios y provocando divorcios en todo el mundo05.8602-10-2026
4La Inteligencia Artificial no nos parece tan consciente como los humanos06.1407-10-2026
5Remedios01001-10-2026
6Seguir el ritmo de la IA en 2026 es imposible: el reto de descubrir cuál es el mejor chatbot a día de hoy 07.5229-09-2026
7¿Puede la IA salvar a los turistas de la multitud de TikTok?05.5223-08-2026
8¿Puede la IA salvar a los turistas de la multitud de TikTok?05.5223-08-2026
9La inteligencia artificial impulsa el fraude en la automoción07.5128-09-2026
10Ataques en enjambre y estafas de 'phishing': los incidentes donde la IA actuó fuera de control06.9414-09-2026

Классификация: Наука. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 5.69. Источник: www.elperiodicomediterraneo.com.