Un estudo innovador supón un paso significativo cara ao desenvolvemento dun sistema de almacenamento de datos dixitais baseado no ADN .
Os datos dixitais están a medrar a un ritmo exponencial hoxe en día debido á nosa dependencia dos dispositivos e requiren un almacenamento robusto a longo prazo. O almacenamento de datos está a converterse lentamente nun desafío porque a tecnoloxía dixital actual non é capaz de proporcionar unha solución. Un exemplo é que nos últimos dous anos creáronse máis datos dixitais que en toda a historia dos ordenadores ; de feito, créanse 2.5 quintillóns de bytes {1 quintillón de byte = 2,500,000 terabytes (TB) = 2,500,000,000 gigabytes (GB)} de datos cada día no mundo. Isto inclúe datos en redes sociais, transaccións bancarias en liña, rexistros de empresas e organizacións, datos de satélites, vixilancia, investigación, desenvolvemento, etc. Estes datos son enormes e non estruturados. Polo tanto, agora é un gran desafío abordar os enormes requisitos de almacenamento de datos e o seu crecemento exponencial, especialmente para organizacións e corporacións que requiren un almacenamento robusto a longo prazo.
As opcións dispoñibles actualmente son o disco duro, os discos ópticos (CD), as memorias, as unidades flash e as unidades de cintas máis avanzadas ou os discos BluRay ópticos que almacenan aproximadamente ata 10 Terabytes (TB) de datos. Estes dispositivos de almacenamento, aínda que se usan habitualmente, teñen moitas desvantaxes. En primeiro lugar, teñen unha vida útil de baixa a media e necesitan almacenarse en condicións de temperatura e humidade idóneas para poder durar moitas décadas e, polo tanto, requirir espazos de almacenamento físico especialmente deseñados. Case todos estes consumen moita enerxía, son voluminosos e pouco prácticos e pódense danar nunha simple caída. Algúns deles son moi caros, adoitan estar plagados de erros de datos e, polo tanto, non son o suficientemente robustos. Unha opción que foi universalmente aceptada pola organización chámase cloud computing, un acordo no que unha empresa contrata basicamente un servidor "exterior" para xestionar todos os seus requisitos de TI e almacenamento de datos, denominado "nube". Unha das principais desvantaxes da computación na nube son os problemas de seguridade e privacidade e a vulnerabilidade aos ataques dos piratas informáticos. Tamén hai outros problemas como os altos custos implicados, o control limitado da organización principal e a dependencia da plataforma. A computación na nube aínda é considerada unha boa alternativa para o almacenamento a longo prazo. Non obstante, parece que a información dixital que se xera en todo o mundo está sen dúbida superando a nosa capacidade de almacenala e son necesarias solucións aínda máis sólidas para atender este diluvio de datos ao tempo que proporciona escalabilidade para ter en conta as futuras necesidades de almacenamento.
O ADN pode axudar no almacenamento informático?
O noso ADN (ácido desoxirribonucleico) está a ser considerado como un medio alternativo emocionante para o almacenamento de datos dixitais. O ADN é o material autorreplicante presente en case todos os organismos vivos e é o que constitúe a nosa información xenética. Un ADN artificial ou sintético é un material duradeiro que se pode fabricar utilizando máquinas de síntese de oligonucleótidos dispoñibles comercialmente. O principal beneficio do ADN é a súa lonxevidade, xa que un ADN dura 1000 veces máis que o silicio (chip de silicio, o material utilizado para construír ordenadores ). Sorprendentemente, só un milímetro cúbico de ADN pode conter un quintillón de bytes de datos! O ADN tamén é un material ultracompacto que nunca se degrada e pode almacenarse nun lugar fresco e seco durante centos de séculos. A idea de usar o ADN para o almacenamento existe desde hai moito tempo, remóntase a 1994. A razón principal é a forma similar na que se almacena a información nun ordenador e no noso ADN , xa que ambos almacenan os planos da información. Un ordenador almacena todos os datos como 0 e 1 e o ADN almacena todos os datos dun organismo vivo usando as catro bases: timina (T), guanina (G), adenina (A) e citosina (C). Polo tanto, o ADN podería considerarse un dispositivo de almacenamento estándar, igual que un ordenador, se estas bases se poden representar como 0 (bases A e C) e 1 (bases T e G). O ADN é resistente e duradeiro, e o reflexo máis simple é que o noso código xenético (o plano de toda a nosa información almacenada no ADN) se transmite eficientemente dunha xeración a outra de forma repetida. Todos os xigantes do software e o hardware están interesados en usar ADN sintético para almacenar grandes cantidades para lograr o seu obxectivo de resolver o arquivo de datos a longo prazo. A idea é converter primeiro os 0 e 1 do código informático no código de ADN (A, C, T, G); o código de ADN convertido úsase despois para producir cadeas sintéticas de ADN que logo se poden gardar en frío. Sempre que sexa necesario, as cadeas de ADN pódense retirar do almacenamento en frío e a súa información descodificarse usando unha máquina de secuenciación de ADN, e a secuencia de ADN finalmente tradúcese de volta a un formato informático binario de 1 e 0 para ser lida no ordenador.
Demostrouse 1 que só uns poucos gramos de ADN poden almacenar quintillóns de bytes de datos e mantelos intactos ata 2000 anos. Non obstante, esta simple comprensión enfrontouse a algúns desafíos. En primeiro lugar, é bastante caro e tamén dolorosamente lento escribir datos no ADN, é dicir, a conversión real de 0 e 1 ás bases do ADN (A, T, C, G). En segundo lugar, unha vez que os datos se "escriben" no ADN, é difícil atopar e recuperar ficheiros e require unha técnica chamada secuenciación do ADN (un proceso que determina a orde precisa das bases dentro dunha molécula de ADN) e, despois do cal, os datos se decodifican de novo a 0 e 1.
Un estudo recente2 realizado por científicos de Microsoft Research e da Universidade de Washington conseguiu un "acceso aleatorio" ao almacenamento de ADN. O aspecto do "acceso aleatorio" é moi importante porque significa que a información pode transferirse a ou desde un lugar (xeralmente unha memoria) no que se pode acceder directamente a cada localización, independentemente de onde estea na secuencia. Usando esta técnica de acceso aleatorio, os ficheiros poden recuperarse do almacenamento de ADN dun xeito selectivo en comparación con antes, cando tal recuperación requiría secuenciar e descodificar un conxunto de datos de ADN completo para atopar e extraer os poucos ficheiros que se desexaban. A importancia do "acceso aleatorio" aumenta aínda máis cando a cantidade de datos aumenta e se fai enorme, xa que reduce a cantidade de secuenciación que se necesita facer. É a primeira vez que se demostra o acceso aleatorio a unha escala tan grande. Os investigadores tamén desenvolveron un algoritmo para descodificar e restaurar datos de forma máis eficiente con maior tolerancia aos erros de datos, o que fai que o procedemento de secuenciación sexa tamén máis rápido. Neste estudo codificaronse máis de 13 millóns de oligonucleótidos de ADN sintético, que eran datos dun tamaño de 200 MB que constaban de 35 ficheiros (que contiñan vídeo, audio, imaxes e texto) con tamaños que variaban entre os 29 KB e os 44 MB. Estes ficheiros recuperáronse individualmente sen erros. Ademais, os autores idearon novos algoritmos que son máis robustos e tolerantes a erros á hora de escribir e ler as secuencias de ADN. Este estudo, publicado en Nature Biotechnology, supón un avance importante que mostra un sistema viable a grande escala para o almacenamento e a recuperación de ADN.
O sistema de almacenamento de ADN parece moi atractivo porque ten unha alta densidade de datos, alta estabilidade e é doado de almacenar, pero obviamente ten moitos desafíos antes de que poida ser adoptado universalmente. Algúns factores son o tempo e a laboriosidade da descodificación do ADN (a secuenciación) e tamén a síntese de ADN . A técnica require máis precisión e unha cobertura máis ampla. Aínda que se fixeron avances neste eido, o formato exacto no que se almacenarán os datos a longo prazo, xa que o ADN aínda está en evolución, Microsoft prometeu mellorar a produción de ADN sintético e abordar os desafíos para deseñar un sistema de almacenamento de ADN totalmente operativo para 2020.
***
Fonte (s)
1. Erlich Y e Zielinski D 2017. A fonte de ADN permite unha arquitectura de almacenamento robusta e eficiente. Science. 355(6328). https://doi.org/10.1126/science.aaj2038
2. Organick L et al. 2018. Acceso aleatorio no almacenamento de datos de ADN a grande escala. Nature Biotechnology. 36. https://doi.org/10.1038/nbt.4079
***
