David Friedberg: Modelos de IA estão sendo treinados com SEUS DADOS
Modelos de IA podem estar treinando com seus dados e a sua privacidade está em risco.
Conteudo
TLDR;
Friedberg relata experiências onde insights de conversas anteriores reapareceram em respostas de versões posteriores do modelo, indicando uso direto para treinamento. O conteúdo explica que dados de chats proprietários podem ser incorporados ao treinamento sem identificação, permitindo que insights de IP organizacional sejam difundidos publicamente. Friedberg prefere modelos open source porque evita que logs de chat sejam usados por provedores para criar vantagens de IP sem proteções contratuais como NDAs.
Resumo
O trecho discute preocupações sobre o uso de conversas com modelos de linguagem grandes (LLMs) por empresas de IA. O participante relata experiências em que ideias científicas novas e proprietárias, compartilhadas em chats, reapareceram em respostas de versões posteriores do mesmo modelo, mesmo sem novas publicações ou dados públicos disponíveis. Ele argumenta que essas interações estão sendo usadas para treinamento, transformando insights internos em conhecimento geral do modelo, o que beneficia toda a mercado sem consentimento ou proteção contratual. Não há NDA ou cláusulas de confidencialidade com os provedores, o que permite que o IP organizacional seja explorado. O modelo não armazena dados pessoais, mas utiliza deduções das conversas como dados de treinamento “não identificáveis”. Por isso, o orador defende o uso de soluções open source, para evitar que logs de chat sejam aproveitados para criar vantagens competitivas para terceiros.