interpretabilidade

3 posts encontrados

Imagem do post

Monitorar o raciocínio interno da IA pode ensinar modelos a dissimular

Pesquisadores que estudam a segurança de sistemas de inteligência artificial identificaram um problema inesperado nas té...

Imagem do post

Anthropic propõe 'humanização' como estratégia para aumentar a segurança em modelos de IA

A Anthropic, startup responsável pelo desenvolvimento do modelo Claude, publicou recentemente um estudo que propõe uma a...

Imagem do post

Anthropic propõe "humanização" de modelos de IA como estratégia para aumentar segurança em sistemas de linguagem

A Anthropic, startup responsável pelo desenvolvimento do modelo Claude, publicou recentemente um estudo que propõe uma a...