Hace unos días The Washington Post publicaba un artículo de investigación donde explicaba de dónde había sacado y qué utilizaba ChatGPT como bases de datos para ofrecer su información.
The Washington Post ha analizado el conjunto de datos que contiene contenido de 15 millones de sitios web utilizados para instruir a ChatGPT. El conjunto de datos estaba dominado por sitios web de industrias como el periodismo, el entretenimiento, el desarrollo de software, la medicina y la creación de contenido, siendo Wikipedia, Scribd y patents.google.com los tres sitios principales. Mientras tanto, los sitios web empresariales e industriales representan el 16% de los tokens categorizados.