historia historica

Reunir manuscritos fragmentados de la Geniza de El Cairo con ayuda de la computación

La Geniza de El Cairo: un tesoro disperso

La Geniza de El Cairo, una colección de manuscritos judíos, ofrece una visión única de la historia entre 950 y 1250 d.C. Los fragmentos están repartidos por museos y bibliotecas de todo el mundo, lo que dificulta su estudio.

El problema de la dispersión

Descubiertos alrededor de 1800, los fragmentos provienen del depósito (geniza) de una sinagoga en El Cairo, Egipto. Dado que los documentos en una geniza suelen quemarse con el tiempo, los manuscritos que sobrevivieron son especialmente valiosos. Aproximadamente 193 000 de los 280 000 fragmentos se encuentran en Cambridge (Inglaterra), pero también hay grandes colecciones en Nueva York (EE. UU.) y Manchester (Inglaterra). Cada vez más fragmentos se digitalizan, pero sigue sin estar claro cuáles pertenecen al mismo manuscrito.

Una solución informática

Investigadores de la Universidad de Tel Aviv y del Friedberg Geniza Project desarrollaron joins, un sistema que identifica grupos de fragmentos que provienen del mismo documento mediante procesamiento de imágenes.

Preprocesamiento de la imagen

Las fotos originales presentan fondos variables, fragmentos torcidos o instrumentos (como reglas) en la escena. El sistema primero aisla cada fragmento, lo endereza y lo convierte a blanco y negro para que la computadora lo analice rápidamente.

Detección de líneas rectas

Para determinar la orientación del texto se emplea la transformada de Hough, una técnica que identifica líneas rectas en una imagen. Cada píxel se representa como una familia de posibles líneas mediante la ecuación . Al acumular todas esas combinaciones, aparecen picos blancos en el espacio Hough que corresponden a líneas reales en la foto.

Aplicación a la escritura

En los manuscritos no hay líneas geométricas evidentes, pero los píxeles que forman los caracteres están alineados. La transformada muestra picos en ±90°, que representan las diez filas de texto horizontales del documento. El ángulo t con mayor varianza indica la rotación del texto (por ejemplo, t=45° implica una rotación de 45°).

De texto a vectores numéricos

Una vez corregida la rotación, el sistema genera un perfil de proyección: suma los píxeles por columna y por fila, obteniendo medidas como número de líneas, espaciado y altura de línea. Además, se extraen puntos clave mediante la técnica SIFT, que identifica características visuales distintivas.

Todos estos datos se agrupan en un vector de características, una lista de números que describe cada fragmento de forma que la computadora pueda compararlos fácilmente.

Aprendizaje automático para unir fragmentos

El núcleo del método es un clasificador que, a partir de un vector de características, decide a qué grupo (documento) pertenece un fragmento. El clasificador se entrena con un conjunto de entrenamiento formado por pares de fragmentos ya conocidos como “uniones” (joins). Aprende qué diferencias de tamaño de fuente, espaciado y puntos clave separan un documento de otro.

Resultados y limitaciones

Al probar el sistema con fragmentos de una única institución, alcanzó una precisión del 80 %. En un escenario más exigente, con fragmentos de distintas colecciones, el 24 % de los 2 000 pares propuestos resultó correcto. Aunque el número de nuevas uniones sugeridas (≈1 000) supera con creces las encontradas manualmente, la tasa de falsos positivos sigue siendo alta, por lo que la revisión humana sigue siendo necesaria.

En resumen, joins representa un avance prometedor para reconstruir los manuscritos de la Geniza de El Cairo, ofreciendo una herramienta que acelera la identificación de fragmentos relacionados, aunque aún requiere supervisión experta.