Em 28 de agosto de 2026, a Sony Music Publishing e a Warner Chappell Music ingressaram com uma ação conjunta contra a Anthropic, o CEO Dario Amodei e o cofundador Benjamin Mann no Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia. As editoras acusam a desenvolvedora do Claude de promover uma campanha sistemática de pirataria para obter obras protegidas e treinar o modelo, enquanto a Anthropic negou as alegações e afirmou que pretende se defender vigorosamente em tribunal. O caso ajuda a desbugar uma disputa que passa por duas pontes: a origem dos dados usados na inteligência artificial e a forma como letras podem aparecer na resposta ao usuário. A reportagem da TechCrunch sobre o processo detalha a acusação apresentada pelas empresas de música.
Uma acusação que começa na origem dos dados
Segundo as autoras, a Anthropic conduziu uma "campanha ousada" de pirataria que combinou torrents com scraping, termo usado aqui para descrever a raspagem de conteúdo de páginas da web. A petição afirma que esse material protegido por direitos autorais entrou no processo de treinamento do Claude. A distinção é relevante para entender o caso: o que existe neste momento são alegações apresentadas ao tribunal, e não uma decisão judicial que já tenha reconhecido a infração. A pergunta prática para quem acompanha a inteligência artificial é de onde veio cada conjunto de dados e quais permissões existiam para seu uso, e a descrição dos métodos leva ao primeiro episódio citado no processo.
Entre os episódios apresentados pelas gravadoras, a petição alega que, em junho de 2021, o cofundador Benjamin Mann baixou 5 milhões de livros via BitTorrent do Library Genesis. O documento associa uma pessoa, uma data, um volume e uma origem específica ao material que teria sido obtido para alimentar o treinamento da Anthropic. Como a informação aparece na forma de acusação, ela precisa ser lida como parte da argumentação das empresas de música, sem ser convertida em uma conclusão sobre responsabilidade. Ao apontar esse download em larga escala, o processo prepara a transição para outro conjunto de arquivos que, segundo as autoras, teria sido obtido no ano seguinte.
Na sequência, o processo afirma que funcionários da Anthropic baixaram mais 2 milhões de livros do Pirate Library Mirror em 2022. A petição usa esse segundo episódio para sustentar a ideia de que a coleta teria ocorrido de forma repetida, reunindo volumes adicionais de material protegido. A referência a anos diferentes também dá à acusação uma dimensão temporal, pois as empresas não descrevem um único arquivo isolado, e sim uma série de ações que teriam abastecido o desenvolvimento do Claude. A partir dessa trilha de livros, a disputa chega ao conteúdo musical e às páginas usadas como fonte de letras.
Dois caminhos citados para alimentar o Claude
Quando a petição passa dos torrents para a web, ela cita a raspagem de sites licenciados como Musixmatch e LyricFind. As empresas afirmam que a Anthropic teria coletado materiais desses serviços para alimentar o treinamento do Claude, em violação aos termos de serviço. O ponto de tensão está na diferença entre acessar um conteúdo disponível na internet e ter autorização para reutilizá-lo em um modelo de inteligência artificial: a acusação sustenta que essa passagem não respeitou as condições estabelecidas pelas plataformas. Assim, a discussão deixa de ser apenas sobre arquivos baixados e alcança também a maneira como sistemas automatizados consultam serviços conectados.
Além dos sites licenciados, a ação menciona bases de dados como Common Crawl e Books3 entre as fontes que teriam sido usadas no treinamento. A petição apresenta esses repositórios ao lado dos demais materiais para descrever o conjunto de dados que, segundo Sony e Warner, foi incorporado ao desenvolvimento do Claude sem a autorização necessária. Para o leitor, o termo "base de dados" pode esconder uma diferença decisiva: cada coleção pode ter regras próprias sobre acesso, cópia e reutilização, e a existência de um arquivo disponível não resolve sozinha a questão dos direitos. Essa dúvida conduz à terceira base citada pelas gravadoras.
O inventário apresentado no processo também inclui The Pile, citado entre as fontes usadas para alimentar o modelo. A menção amplia a descrição feita pelas gravadoras sobre a origem dos dados, que reúne materiais obtidos por torrent, raspagem de páginas e coleções digitais. A tese das autoras é que esses caminhos formaram uma operação contínua de aquisição de conteúdo protegido, enquanto a Anthropic terá de responder judicialmente à forma como cada fonte foi utilizada. É nessa ligação entre entrada de dados e comportamento do sistema que a acusação encontra seu exemplo mais direto: as letras que o Claude seria capaz de reproduzir.
O conteúdo musical no centro da disputa
A acusação ganha uma dimensão concreta quando as empresas afirmam que o Claude reproduz letras de músicas literalmente, sem citar o autor. "Literalmente" corresponde, neste caso, à reprodução palavra por palavra, em vez de uma resposta que apenas descreva o tema ou crie um texto novo. Entre os exemplos mencionados estão "All I Want for Christmas is You" e "Eye of the Tiger". As gravadoras usam esses casos para argumentar que o modelo não teria apenas absorvido padrões gerais de linguagem musical, mas poderia entregar ao usuário trechos reconhecíveis de obras protegidas, conectando o treinamento ao resultado visível na interação com a ferramenta.
Essa discussão também envolve a suposta remoção de informações de gestão de direitos autorais, conhecidas pela sigla CMI. Esses dados servem para identificar a obra e sua relação com os titulares, e a nova ação afirma que eles teriam sido retirados do material utilizado. Além das indenizações por cópia, as empresas pedem uma multa adicional de US$ 25 mil por caso relacionado à remoção indevida dessas informações. A acusação, portanto, combina a reprodução do conteúdo com a perda dos dados que ajudam a indicar quem deve ser reconhecido e protegido, levando a disputa para a dimensão financeira.
Bilhões em indenizações e uma disputa maior
A petição busca até US$ 150 mil por obra infringida, valor que pode levar a indenização potencial para a casa dos bilhões de dólares. O cálculo citado pelas fontes não é apresentado como uma quantia já determinada pelo tribunal, mas como o resultado possível da aplicação do limite pedido a cada infração deliberada. A diferença entre uma cobrança por obra e uma cobrança única muda a escala do processo, porque a discussão passa a considerar a quantidade de músicas e outros trabalhos envolvidos. Os detalhes financeiros publicados pela Music Business Worldwide mostram por que a ação foi descrita como multibilionária.
Esse valor se soma a uma sequência de disputas que já envolve a Anthropic. A Universal Music Group e o Concord Music Group moveram ações anteriores que buscam mais de US$ 3 bilhões em danos, de acordo com as informações reunidas sobre o caso. A nova ação de Sony e Warner, por isso, aparece como o mais recente litígio de gravadoras contra a empresa de inteligência artificial, ampliando a pressão jurídica sobre o uso de obras protegidas no treinamento de modelos. O histórico recente inclui ainda um acordo de US$ 1,5 bilhão com autores de livros, que Sony e Warner criticaram ao sugerir que a Anthropic trata pagamentos desse tipo como custo operacional do negócio.
Defesa anunciada e tribunal como próximo palco
Depois das acusações sobre livros, bases de dados e letras, a posição pública da Anthropic é de negação das alegações. A empresa declarou que pretende se defender vigorosamente em tribunal, o que coloca a contestação formal da petição como o próximo passo anunciado pela companhia. Até aqui, as fontes apresentam versões opostas: as gravadoras descrevem uma campanha sistemática de violação de propriedade intelectual, enquanto a Anthropic rejeita essa descrição. A disputa seguirá, portanto, no espaço judicial em que deverão ser examinados os métodos de coleta, as permissões de uso e a reprodução atribuída ao Claude, sem que a acusação seja tratada como veredito antecipado.