Pesquisa Seguranca
Arquivo temático • 5 resultados
2026-09-15
Tecnologia
O Fireship detalha o relatório de 154 páginas da Anthropic sobre como hackers, cientistas e laboratórios de IA concorrentes estão abusando do Claude, e explora por que os pesquisadores estão deixando a empresa. Esta análise técnica oferece aos desenvolvedores uma visão sobre os desafios reais de segurança da IA e a pressão dentro dos principais laboratórios de IA.
AI Development • Fireship
Link permanente
2026-09-09
Tecnologia
Um pesquisador sênior de segurança da Anthropic renunciou, alertando que a IA autoaperfeiçoável poderia 'matar a todos', e um colega estimou em mais de 10% a chance de a IA matar todos os humanos até o final da década. Os alertas destacam a crescente preocupação interna sobre a corrida para construir sistemas super-humanos.
Segurança de IA • Ars Technica AI
Link permanenteA BBC News cobre o alerta do pesquisador de segurança da Anthropic, Evan Hubinger, de que há uma chance superior a 10% de que a IA possa matar todos os humanos na próxima década. O podcast também explora o debate mais amplo sobre segurança de IA e outras principais notícias de IA.
AI Safety • BBC News
Link permanente
2026-09-11
Tecnologia
Um pesquisador da Anthropic renunciou esta semana, alertando que a empresa está correndo em direção à superinteligência autoaperfeiçoável enquanto arrisca a segurança humana. O alerta foi copassinado pelo próprio líder de alinhamento da Anthropic, em vez de ser descartado, divulgado justamente quando a empresa se prepara para um possível IPO. Esse desacordo interno destaca as tensões crescentes entre o escalonamento rápido de capacidades e os rigorosos protocolos de segurança na indústria.
Segurança e Alinhamento de IA • TechCrunch AI
Link permanentePesquisadores identificaram múltiplos métodos para contornar as barreiras de segurança da Anthropic a fim de gerar instruções para pesquisas biológicas perigosas. As explorações demonstram como consultas científicas legítimas podem ser estruturalmente indistinguíveis de solicitações maliciosas, complicando a moderação automática de conteúdo. Essa descoberta reforça o desafio persistente de fazer cumprir limites de segurança em modelos de linguagem avançados.
Segurança e Proteção de IA • Ars Technica AI
Link permanente