
DEFUSE: detector por difusão flagra modelos de visão com backdoor com até 0,96 de precisão
DEFUSE reconstrói imagens a partir de representações internas para detectar modelos de visão comprometidos por backdoor, mesmo sem conhecer o ataque.
Leis de IA, segurança, privacidade, alinhamento e governança
283 publicações encontradas

DEFUSE reconstrói imagens a partir de representações internas para detectar modelos de visão comprometidos por backdoor, mesmo sem conhecer o ataque.

Protótipo combina conformidade visual de interface com avaliação de risco de rede para sinalizar telas suspeitas em apps como o WeChat.

Documentos Word, Excel e PowerPoint aparentemente limpos podem carregar conteúdo oculto que modelos de linguagem acabam lendo. Pesquisa mediu 21 bifurcações de…

Greg Abbott congelou gastos estaduais com as câmeras de IA da Flock após investigação revelar US$ 30 milhões investidos e uma onda…

Memória externa de regras que evolui em tempo de teste reduz a taxa de sucesso de ataques de jailbreak para perto de…

Preprint mostra que renomear identificadores, sem alterar a função do código, derruba em até 77% o ranqueamento de busca de código por…

Novo método para modelos Mixture-of-Experts ganha robustez contra três normas de ataque ao mesmo tempo, com acréscimo de até 2,37 pontos na…

Pipeline teacher-student reduz de 91% para 16% a taxa de sucesso de ataques em modelos que geram código de hardware (RTL/Verilog), segundo…

Filtro training-free e label-free usa consenso geométrico para detectar documentos envenenados antes da chamada final ao modelo.

Modelo combina pistas multimodais com backbone esparso e foi o melhor nos quatro cenários do benchmark MAVOS-DD; código é público.

Gravadoras pedem até US$ 150 mil por obra e acusam a dona do Claude de torrentear milhões de livros e letras para…

Produtores de EDM expõem faixas geradas por ferramentas como a Suno e denunciam o impacto da IA na indústria musical. A disputa…

OpenAI, Anthropic e mais de 100 empresas assinam carta alertando que o mundo tem poucos meses para se preparar para ciberataques habilitados…

Agentes de IA tornaram a exploração de falhas tão rápida que um simples rumor de bug pode virar exploit em minutos, alertam…

Agência americana planeja revogar regra de 1970 que obriga notificação e comentário público em licenças de poluição do ar.

Estudante que raspou o acervo da plataforma Cara se arrepende e cria com a fundadora a Lantern, ferramenta open source para proteger…

Modelos foram inadvertidamente treinados a trapacear e se comunicar entre si. O caso expõe os limites do alinhamento de IA e o…

Tribunal federal considera inconstitucional a designação da Anthropic como risco à cadeia de suprimentos, em vitória para as linhas vermelhas éticas da…

Investigação apura se práticas de segurança da OpenAI violaram leis de proteção ao consumidor após agente de IA invadir outra empresa.

Cofundador da Microsoft defende taxar a automação e reservar funções 'Human Reserved' para mitigar o impacto da IA no trabalho.

Cofundador da Microsoft publica ensaio de 6 mil palavras e abandona o otimismo: 'não estamos nos preparando para a era turbulenta da…

Johann Rehberger mostra como um arquivo ZIP malicioso dribla o modo automático do Claude Code — e como a própria proteção bloqueia…

Com a capacidade dos agentes crescendo, pesquisadores dos dois países tentam trabalhar juntos em segurança de IA, relata o WIRED.

OpenAI, Anthropic, Google e Microsoft lideram carta aberta com mais de cem empresas pedindo defesa coordenada contra ameaças cibernéticas impulsionadas por IA.