LA BIBLIOTECA DE LAS MÁQUINAS. Entrega 1: El libro que entró y no volvió. Por Oscar Rodríguez
Millones de libros fueron escaneados por la IA: ¿Bibliotecas invisibles para instruir algoritmos? ¿La memoria escrita es la materia prima de las máquinas?
LA BIBLIOTECA DE LAS MÁQUINAS
Una saga sobre memoria, cultura, inteligencia artificial y poder
Por Oscar Rodríguez
ENTREGA I
EL LIBRO QUE ENTRÓ Y NO VOLVIÓ
El libro no sabía que iba a morir.
Naturalmente, los libros no saben nada.
Pero imaginemos por un instante que éste sí.
Que recuerda.
Que alguna vez estuvo nuevo sobre una mesa.
Que alguien lo abrió por primera vez.
Que pasó años en una biblioteca.
Después en una casa.
Después en una caja.
Quizás terminó en una librería de usados.
No sabemos cuál era.
Eso es lo mejor de esta historia.
Podría haber sido cualquiera.
Una novela.
Un ensayo político.
Un libro de historia.
Un manual universitario.
Tal vez alguien subrayó una frase.
Tal vez en la primera página todavía quedaba una dedicatoria:
Para GABI, con amor.
Después ocurrió algo inesperado.
Alguien lo compró.
No para leerlo.
No para colocarlo en una biblioteca.
Ni siquiera para venderlo otra vez.
Su destino era una máquina.
Primero desapareció la encuadernación.
Después cortaron el lomo.
Las páginas quedaron sueltas.
Una encima de otra.
La máquina empezó a tragarlas.
Una luz blanca recorrió la primera.
Después la segunda.
Después otra.
Y otra.
El papel avanzaba.
En algún lugar aparecía un archivo digital.
Página.
Archivo.
Página.
Archivo.
¿Qué clase de biblioteca contiene millones de libros pero no fue construida para que nosotros podamos entrar?
Hasta que finalmente ocurrió algo extraño.
Del libro quedaban dos cosas.
Por un lado, papel separado, inutilizado como ejemplar.
Por el otro, una copia digital perfectamente ordenada.
Una había nacido de la destrucción de la otra.
El libro físico fue descartado.
El archivo quedó.
Y seguramente esta historia sería apenas una metáfora inquietante sobre nuestro tiempo…
si no fuera porque ocurrió realmente.
El 23 de junio de 2025, un juez federal de California llamado William Alsup publicó una resolución en el caso Bartz v. Anthropic.
Y entre sus páginas apareció la descripción del procedimiento.
Anthropic, la empresa creadora del modelo de inteligencia artificial Claude, había gastado millones de dólares comprando millones de libros impresos, frecuentemente usados.
Después contrató proveedores.
Los proveedores retiraban las encuadernaciones.
Cortaban las páginas.
Las escaneaban.
Creaban archivos digitales con texto procesable por máquinas.
Y descartaban los ejemplares originales.
No uno.
No cien.
Millones.
El expediente incluso utiliza una expresión fría, casi quirúrgica:
destructive scanning.
Escaneo destructivo.
Hay expresiones jurídicas que parecen haber sido inventadas por un novelista.
Ésta podría ser una de ellas.
Porque reúne dos acciones aparentemente contradictorias.
Destruir.
Y conservar.
Pensemos por un momento qué estaba ocurriendo.
El libro entraba en la máquina como un objeto.
Salía convertido en información.
La tapa podía desaparecer.
El pegamento.
La textura.
El desgaste.
El ejemplar que había circulado entre personas.
Pero las palabras permanecían.
Incluso mejoradas para determinada finalidad.
Ahora podían buscarse.
Clasificarse.
Procesarse.
Relacionarse automáticamente con millones de otras palabras.
Entonces apareció una pregunta que no pude sacarme de la cabeza.
¿Seguía siendo el mismo libro?
Anthropic estaba construyendo algo.
En los documentos judiciales aparece como una biblioteca central.
Una colección gigantesca destinada a conservar libros digitalizados y permitir diferentes usos internos.
Desde allí podían seleccionarse conjuntos y subconjuntos de textos para entrenar distintos modelos de lenguaje.
Biblioteca.
La palabra tranquiliza.
Estamos acostumbrados a ella.
Una biblioteca es un lugar donde los libros esperan lectores.
Pero ésta tenía algo diferente.
No estaba construida principalmente para que entráramos nosotros.
No había una sala de lectura.
No había bibliotecario detrás de un mostrador.
No había vecinos buscando una novela.
Había servidores.
Archivos.
Metadatos.
Corpus.
Y máquinas aprendiendo relaciones entre palabras.
Entonces comprendí que quizás estábamos utilizando una palabra antigua para nombrar una cosa completamente nueva.
Aquí la historia se vuelve jurídica.
Y bastante extraña.
Anthropic había comprado aquellos ejemplares.
Legalmente eran suyos.
Un libro comprado puede revenderse.
Regalarse.
Un documento nunca es solamente su contenido. También importa saber de dónde vino
Prestarse.
Incluso destruirse.
Pero existe una diferencia que muchas veces olvidamos.
Cuando compramos un libro…
no compramos la obra.
Compramos un ejemplar.
No compramos los derechos para imprimir cien mil copias.
No adquirimos el copyright.
Somos propietarios del objeto.
No necesariamente de aquello intelectualmente contenido en él.
Por eso había una pregunta que el tribunal tenía que resolver.
Anthropic podía destruir el libro.
Pero…
¿podía destruirlo mientras fabricaba una copia digital?
El juez dijo que, en aquellas circunstancias concretas, sí.
La razón es importante.
Cada ejemplar comprado era reemplazado por una copia digital interna.
No se conservaban, según el razonamiento aplicado por el tribunal, dos ejemplares de biblioteca a partir de uno.
Se cambiaba el formato.
Papel por archivo.
El ejemplar físico desaparecía y su sustituto digital permanecía dentro de la empresa, facilitando almacenamiento y búsqueda.
Alsup consideró ese cambio de formato un uso transformativo y, en esas condiciones, fair use.
Hasta ahí podríamos cerrar el expediente.
Libro comprado.
Libro destruido.
Libro digitalizado.
Caso resuelto.
Pero había un problema.
No todos los libros habían entrado por la misma puerta.
En algún punto de la historia aparece una segunda entrada.
No tiene cajas.
No tiene pallets.
No necesita camiones.
Solamente una conexión a Internet.
Books3.
LibGen.
PiLiMi.
Nombres que quizá para la mayoría no significan nada.
Para el expediente significaban millones de libros descargados desde repositorios piratas.
Más de siete millones de copias, según la resolución.
También fueron incorporadas a aquella biblioteca central.
Y aquí sucede algo fascinante.
Imaginemos dos archivos.
Los abrimos.
El texto puede ser idéntico.
Las mismas palabras.
Los mismos capítulos.
El mismo autor.
Uno proviene de un ejemplar comprado, cortado y escaneado.
El otro fue descargado de una biblioteca pirata.
Desde una computadora podrían parecer prácticamente iguales.
Pero para el tribunal había una diferencia enorme.
Su historia.
La procedencia.
El juez separó expresamente ambos caminos.
El libro ya no participaba solamente de una relación entre autor y lector. Entraba en otra cadena: Libro. Digitalización. Corpus. Entrenamiento. Modelo. Producto. Infrestructura
Comprar un ejemplar después de haber obtenido ilegalmente otra copia no borraba el origen de aquella primera adquisición.
Una finalidad transformativa posterior no convertía automáticamente en lícita la forma utilizada para conseguir el material.
Y entonces aparece algo que cualquier bibliotecario comprende inmediatamente.
Un documento nunca es solamente su contenido.
También importa saber de dónde vino.
Volvamos al ejemplar que seguimos desde el comienzo.
Había pasado buena parte de su existencia cumpliendo una tarea bastante sencilla.
Ser leído.
Pero ahora tenía otra función.
Sus palabras podían pasar a formar parte de enormes conjuntos de datos utilizados para desarrollar modelos capaces de generar lenguaje.
El libro ya no participaba solamente de una relación entre autor y lector.
Entraba en otra cadena.
Libro.
Digitalización.
Corpus.
Entrenamiento.
Modelo.
Producto.
Infraestructura.
Entonces apareció ante mí una idea que me parece más inquietante que la destrucción del papel.
El libro había cambiado de profesión.
Seguía conteniendo las mismas palabras.
Pero la red alrededor de esas palabras había cambiado completamente.
Antes una persona podía comprarlo por diez dólares.
Ahora millones de libros reunidos podían contribuir al desarrollo de una tecnología valuada en miles de millones.
Y ésa es una transformación que el precio del ejemplar usado no alcanza a describir.
Aquí aparece la pregunta más difícil.
Todos aprendemos leyendo.
Ningún escritor nació sin otros escritores.
Ningún investigador empezó de cero.
Ningún profesor creó solo todo aquello que enseña.
Nuestra cultura consiste precisamente en recibir conocimiento anterior, transformarlo y producir algo nuevo.
Entonces alguien podría preguntar:
—Si nosotros podemos aprender de los libros, ¿por qué una inteligencia artificial no?
Es una buena pregunta.
Quizás demasiado buena.
Porque obliga a pensar en la diferencia.
Un ser humano puede leer cientos o miles de libros durante una vida.
Una infraestructura computacional puede procesar millones.
Un lector transforma lo leído dentro de una experiencia biográfica singular.
¿Seguía siendo el mismo libro? Anthropic estaba construyendo algo. En los documentos judiciales aparece como una biblioteca central. Una colección gigantesca destinada a conservar libros digitalizados y permitir diferentes usos internos
Una empresa puede utilizar grandes corpus para desarrollar un sistema replicable y comercializable a escala planetaria.
¿La diferencia es solamente de cantidad?
¿O llega un momento en que la cantidad cambia la naturaleza de aquello que estamos haciendo?
No tengo una respuesta definitiva.
Y quizás ésa sea precisamente la pregunta que debemos conservar.
Hay algo que debemos evitar.
La comparación fácil.
Esto no fue una quema nazi de libros.
No hubo un intento documentado de eliminar determinadas ideas.
Los textos no fueron destruidos para impedir su lectura.
En realidad sucedió casi lo contrario.
Los ejemplares fueron destruidos para conservar computacionalmente aquello que contenían.
Y eso hace la escena mucho más extraña.
En las viejas historias autoritarias, destruir un libro significaba eliminar información.
Aquí destruir el ejemplar podía formar parte del proceso para aumentar la capacidad de procesar esa información.
La hoguera quería que las palabras desaparecieran.
El escáner quiere que sobrevivan.
Pero de otra manera.
Para otra cosa.
Dentro de otra estructura de poder.
El conflicto por las copias pirateadas continuó.
En 2026, un tribunal federal aprobó definitivamente un acuerdo por 1.500 millones de dólares entre Anthropic y autores en la acción colectiva relacionada con los libros pirateados.
Fue uno de los acuerdos de copyright más importantes registrados en Estados Unidos.
Pero incluso después de esa cifra gigantesca, la pregunta que me interesa permanece intacta.
Porque los tribunales pueden decidir qué es legal.
Pueden determinar daños.
Pueden interpretar copyright.
Pero hay preguntas que no caben completamente dentro de un expediente.
La hoguera quería que las palabras desaparecieran. El escáner quiere que sobrevivan. Pero de otra manera. Para otra cosa. Dentro de otra estructura de poder
Por ejemplo:
¿qué sucede culturalmente cuando millones de obras dejan de funcionar solamente como libros y comienzan a funcionar como materia prima para máquinas?
Volvamos al depósito.
Nuestro libro sigue allí.
O lo que queda de él.
La máquina casi terminó.
Queda una página.
Solo una. La última….
Avanza lentamente.
Imaginemos que tiene una anotación en el margen.
Una palabra escrita muchos años atrás.
Quizás alguien puso:
Importante.
La luz blanca pasa sobre ella.
El escáner la registra.
No sabemos si esa anotación será útil.
No sabemos si será descartada.
No sabemos siquiera si alguien volverá a verla.
Después la página desaparece.
El archivo queda almacenado.
La máquina espera.
Y detrás aparece otro libro.
Después otro.
Después otro.
Hasta perderse de vista.
Por primera vez comprendo que el misterio no estaba en saber qué máquina cortaba los libros.
Eso ya lo sabemos.
Tampoco estaba en descubrir quién los había comprado.
También lo sabemos.
El verdadero misterio estaba detrás.
En aquella biblioteca invisible que empezaba a crecer con cada ejemplar que desaparecía.
Millones de obras.
Una cantidad de conocimiento que ningún ser humano podría leer durante una vida.
Quizás durante miles de vidas.
Y sin embargo alguna cosa podía recorrerlas.
Procesarlas.
Relacionarlas.
Aprender de ellas.
Entonces apagan las máquinas.
El depósito queda oscuro.
Pero la biblioteca no.
En algún lugar los servidores siguen encendidos.
Y allí aparece la pregunta que abre nuestra próxima historia.
¿Qué clase de biblioteca contiene millones de libros pero no fue construida para que nosotros podamos entrar?
Próxima entrega de La biblioteca de las máquinas
LA BIBLIOTECA QUE NADIE PUEDE VISITAR
Quizás durante siglos nos preocupamos por garantizar que todas las personas pudieran entrar a las bibliotecas.
Ahora aparece un problema completamente diferente.
Las bibliotecas más poderosas del futuro podrían ser precisamente aquellas a las que ningún ciudadano tenga acceso.