Addestramento “Bioinformatica”

Energia Verde & ICT: Dalle Strategie Intelligenti a quelle Sagge

 LIVELLO BASE

Al giorno d’oggi, sono in preparazione nuovi regolamenti che mirano a proporre informazioni sui codici di contatto per campi specifici e anche per gli individui per trovare fonti alternative di energia.

Sommario

 

L’energia Verde

Al giorno d’oggi, sono in preparazione nuovi regolamenti che mirano a proporre informazioni sui codici di contatto per campi specifici e anche per gli individui per trovare fonti alternative di energia. Queste fonti alternative devono fornire energia agli edifici privati e pubblici, e allo stesso tempo generare un basso numero di composti tossici. Questo è il cosiddetto approccio “going green”. Sono stati progettati diversi tipi di energia alternativa, come l’energia solare e nucleare, con lo scopo di salvare il pianeta, perché le emissioni tossiche che accompagnano la produzione di quelle tradizionali sono un problema enorme, dato che influenzano negativamente la vita mondiale.

Insieme alle azioni tossiche ampiamente indagate del riscaldamento globale negli ultimi anni, si vagheggia in parallelo il danno fornito da altre risorse utilizzate nella produzione di cibo e nel mantenimento dell’acqua pulita. La società ha fatto riferimento a materiali come il carbone, il petrolio e persino il kerosene per garantire l’energia necessaria. I combustibili fossili, il carbone, il petrolio e altre risorse usate per la produzione di energia emettono effetti collaterali dannosi. Questi combustibili non sono rinnovabili e contaminano l’ambiente e l’atmosfera, incidendo sulle fonti necessarie per la sopravvivenza delle specie che abitano il nostro pianeta. Poiché queste fonti sono naturalmente limitate, i problemi per la loro scarsità e l’accesso sono in aumento, il peggiore è il loro effetto nocivo sull’ambiente. Così, l’uso di queste fonti convenzionali di energia contribuisce al riscaldamento globale. Il carbone e il petrolio emettono gas tossici nell’ambiente, e in questo modo mettono in pericolo la salute generale aumentando i problemi respiratori, e diminuiscono la qualità della vita.

L’energia verde aiuterà ad alleviare e ad appianare almeno alcuni di questi problemi, e quanto più velocemente passeremo a fonti di energia rinnovabili, tanto meglio.

Cos'è l'energia verde?

L’effetto umano sull’ambiente diventa un valore sostanziale del trasferimento dalle risorse energetiche standard a quelle rinnovabili e diventa ovvio per gli utenti. Così, l’energia verde è un criterio per una migliore sostenibilità nella rete elettrica, e questo significato differisce dal termine risorsa rinnovabile. Rispettando l’Agenzia per la protezione dell’ambiente (EPA), l’energia verde fornisce un profondo valore ambientale e comprende l’energia ottenuta da solare, eolica, geotermica, biogas, idroelettrica a basso impatto e alcune fonti di biomassa ammissibili.

L’energia rinnovabile implica le stesse fonti dell’energia verde; l’energia prodotta è realizzata con tecnologie e prodotti che hanno un notevole impatto sull’ambiente locale e globale. Quando l’energia verde è legata all’applicazione in diversi progetti di energia rinnovabile, hanno un input in queste tecnologie.

L’energia verde è qualsiasi tipo di energia prodotta sulla base di risorse naturali, come la luce del sole, il vento o l’acqua. Spesso esce dalle fonti di energia rinnovabile tenendo conto delle variazioni stabilite per l’energia rinnovabile e verde menzionate sopra. La regola di base importante per queste risorse energetiche è che non sono dannose per l’ambiente rilasciando gas serra nell’atmosfera. L’energia verde produce energia da risorse naturali senza effetti collaterali negativi che inquinano l’atmosfera e la superficie della Terra. Oltre all’energia solare ed eolica, molte altre alternative ecologiche potrebbero garantire l’energia necessaria per mantenere la vita sul pianeta. L’acqua, il vento e il sole sono stati usati per generare energia, riscaldare l’acqua e far funzionare i macchinari fin dai tempi antichi. Recentemente, le tecnologie si sono ampliate per quanto riguarda i progetti, i tipi e gli usi delle fonti alternative. Anche se la fonte di energia usata può produrre un po’ di inquinamento, le opzioni più verdi minimizzano gli effetti collaterali dannosi. Quindi, le alternative attualmente sfruttate si basano sui nuovi modi per estrarre energia dai combustibili fossili e dal carbone attuali, ma in modi meno dannosi. Questo avviene attraverso lo spostamento dei sottoprodotti nocivi. Tuttavia, al momento, questo è stato meno che efficace e non può ancora essere raggiunto in modi efficienti dal punto di vista dei costi. Tuttavia, ci sono molte alternative che sono opportunità valide

I prodotti dell’energia verde che funzionano

È risaputo che per essere riconosciuta come una risorsa energetica verde non deve produrre inquinamento, come si verifica con i combustibili fossili. Questa evidenza indica che non tutte le fonti utilizzate dall’industria delle energie rinnovabili sono verdi. Così, la generazione di energia che brucia materiale organico da foreste sostenibili è considerata rinnovabile, ma a causa della produzione di CO2 dal processo di combustione, non è verde. Le fonti di energia verde sono di solito completate in modo naturale, in contrasto con le fonti di combustibile fossile come il gas naturale o il carbone, che si sviluppano in milioni di anni. Le fonti verdi spesso evitano anche le operazioni di estrazione o di perforazione che possono danneggiare gli ecosistemi.

Il futuro nel consumo di energia è incentrato sullo sfruttamento di un mix di energia verde, rinnovabile e convenzionale, indipendentemente dal prodotto acquistato. Così, tutte le fonti di energia nella rete elettrica sono mescolate insieme alla rete di trasmissione dell’energia. Per coloro che desiderano diventare verdi in casa e non possiedono opportunità per un array di pannelli solari, il mix menzionato è il modo migliore per ridurre l’impronta di carbonio associata al consumo di energia. È il modo più presumibile per aumentare l’investimento di energia rinnovabile su larga scala e dà a più famiglie e imprese l’accesso all’energia verde.

I tipi di energia verde

La varietà di tipi di energia verde è legata alla grande varietà di fonti (Fig. 1). Alcuni di questi tipi sono più adatti ad ambienti o regioni specifiche. Come fonte di energia, l’energia verde proviene spesso da tecnologie di energia rinnovabile come l’energia solare, eolica, geotermica, biomassa e idroelettrica. Queste tecnologie agiscono attraverso diversi processi.

Trovare una fonte di energia alternativa è l’obiettivo di molti paesi in tutto il mondo. È di importanza strategica scoprire opzioni naturali e rinnovabili come fonte di energia. In alcuni casi, può essere una semplice decisione di trovare disegni architettonici appropriati che mantengano gli edifici freschi d’estate e caldi d’inverno. In un altro, un design anaerobico viene utilizzato nei sistemi di produzione di energia per sostituire i combustibili fossili con altre risorse. Così, la riduzione delle emissioni di carbonio, la prevenzione dei danni ambientali e la creazione di posti di lavoro sono solo alcuni dei vantaggi forniti dall’investimento nell’energia verde.

Figura 1. La varietà di tipi di energia verde

Andare verso il verde significa maggiori finanziamenti per progetti solari, eolici e altre energie rinnovabili, creando tecnologie per sfruttare meglio le fonti rinnovabili e renderle più ammissibili per le persone.

Consumo Energetico nel Settore delle ICT

Attualmente, si stima che le ICT consumino l’1,15% della fornitura totale di elettricità. Si calcola che il consumo totale annuo operativo di elettricità per le ICT è di 242 TWh nel 2015. Questa somma comprende l’elettricità generata in loco (27 TWh) e l’elettricità della rete (215 TWh). Inoltre, il carbonio operativo globale emesso dal settore ICT nel 2015 è di circa 169 M tonnellate di CO2. È equivalente allo 0,53% dell’intera emissione di carbonio del settore energetico (32 G tonnellate) e allo 0,34% dell’emissione globale di carbonio (50 G tonnellate) nel 2015. Il consumo di elettricità nella rete ICT è aumentato del 31% dal 2010 al 2015. Questo aumento è di 185 TWh per 5 anni, che corrisponde all’1% della fornitura totale della rete elettrica. La crescita delle emissioni di carbonio operative è stata del 17% per questo periodo.

Applicando ampiamente il 5G nel prossimo futuro, il tasso di aumento del consumo di energia sarà ancora maggiore.

Approvvigionamento Energetico Verde per le ICT

Oggi, la riduzione delle emissioni di gas serra (GHG) sta diventando uno degli argomenti di ricerca più importanti nelle tecnologie dell’informazione e della comunicazione (ICT) a causa della crescita preoccupante delle emissioni indirette di GHG provenienti dall’uso enorme di dispositivi elettrici ICT. Quindi, la soluzione del problema dei gas serra dell’ICT è legata al miglioramento dell’efficienza energetica attraverso la riduzione del consumo energetico a livello micro.

La ricerca in questo campo si concentra sulla progettazione dei microprocessori, la progettazione dei computer, le architetture power-on-demand e le tecniche di consolidamento delle macchine virtuali. Il metodo di efficienza energetica a micro-livello porterà un aumento complessivo del consumo di energia a causa del postulato di Khazzoom-Brookes (noto anche come paradosso di Jevons) che dice: “i miglioramenti dell’efficienza energetica che, su considerazioni più ampie, sono economicamente giustificati a micro-livello, portano a livelli più elevati di consumo energetico a macro-livello”. Pertanto, potrebbe essere ragionevole che ridurre le emissioni di gas serra a livello macro sia una soluzione più appropriata. Le grandi compagnie ICT, come Microsoft che consuma fino a 27MW di energia in ogni momento, hanno costruito i loro centri dati vicino a fonti di energia verde. Sfortunatamente, molti centri di calcolo non sono collocati vicino a fonti di energia verde. Per questo motivo, la rete distribuita di energia verde è una tecnologia emergente, che permette che le perdite subite nella trasmissione dell’energia sulle infrastrutture delle utility elettriche siano molto più alte di quelle causate dalla trasmissione dei dati. Questo rende il trasferimento di un centro dati vicino a una fonte di energia rinnovabile una decisione più efficiente, a meno che non si porti l’energia in un luogo già esistente.

La gestione e le politiche tecniche saranno una decisione per organizzare la virtualizzazione, che aiuta a spostare le risorse dell’infrastruttura virtuale da un sito all’altro in base alla disponibilità di energia. Questo faciliterà l’uso dell’energia rinnovabile all’interno della rete ICT fornendo uno strumento di gestione “Infrastruttura come servizio (IaaS)”.

Green ICT e modi di rendere più Verdi le ICT

Le ICT Verdi sono un concetto ampio, che manca di una definizione generale. Questo concetto include l’efficienza energetica di attrezzature come computer, server e monitor. Occasionalmente, ha menzionato la produzione di attrezzature ICT così come il riciclaggio. In altri casi, include modi in cui l’ICT può essere usata per mitigare l’impatto ambientale di altri settori.

  • Definizione delle Green ICT

La Green ICT è stata definita in letteratura come “l’uso delle risorse IT in modo efficiente dal punto di vista energetico e dei costi” o “un’iniziativa per incoraggiare gli individui, i gruppi e le organizzazioni impegnate nell’uso dell’ICT a considerare i problemi ambientali e trovare soluzioni ad essi”. Green ICT si occupa dell’impatto ambientale del settore ICT stesso. ICT for Green rivela come l’ICT può essere applicata per rendere altri settori più verdi. Il settore ICT dà circa il 2% delle emissioni mondiali di gas serra, principalmente a causa delle emissioni del segmento dell’aviazione. Anche se questa cifra non sembra molto, alcuni autori considerano che le emissioni del settore ICT sono quelle che crescono di più, con tassi di crescita del 6% all’anno. Inoltre, l’impatto ambientale dell’ICT è ampiamente trascurato, l’aviazione inizia a prestare attenzione all’ambiente decenni fa, ma il settore ICT ha iniziato a prendersi cura dell’ambiente solo oggi. Per quanto riguarda la Green ICT, le principali ICT utilizzate sono presentate nella Fig. 2. Per ciascuna di queste categorie di apparecchiature, ci sono diverse opzioni che possono essere fatte per ridurre l’impatto ambientale. Quando si discute dell’impatto ambientale delle TIC, l’argomento più dibattuto è l’efficienza energetica. Nel frattempo, c’è anche una domanda su tale stima dei materiali utilizzati per la produzione, e il modo di farlo.

Misurare l’efficienza energetica è la metrica più semplice per stimare l’effetto delle Green ICT, a causa del modo semplice di determinare il consumo energetico. A volte può essere usata più energia durante la produzione dell’attrezzatura rispetto alla sua intera durata di vita e questo è il caso dei PC. Quando si producono i computer, vengono utilizzati diversi metalli come alluminio, arsenico, rame e piombo. Alcuni di essi sono pericolosi e creano esigenze di manipolazione delle apparecchiature, specialmente durante il riciclaggio. Si afferma che il 70% di tutti i rifiuti pericolosi sono rifiuti elettronici. Ci sono regolamenti per il riciclaggio dei rifiuti elettronici in molti paesi, ma il riciclaggio informale offre un modo economico per trattare questi rifiuti e purtroppo è molto praticato.

Figura 2. Principali categorie di ICT utilizzate.

  • Andare verso il Verde nelle ICT

Il termine ‘verde’ è usato nel linguaggio quotidiano per riferirsi ad attività sostenibili dal punto di vista ambientale. Inoltre, il termine ‘verde’ è usato ripetutamente come essere sostenibile. Entrambi i concetti sono strettamente collegati, ma non sono identici e essere verdi è solo una parte dell’essere sostenibili. Le Nazioni Unite discutono comunemente tre aspetti dello sviluppo sostenibile: la dimensione sociale, economica e ambientale. Il termine ‘verde’ si adatta all’aspetto ambientale perché entrambi sono spesso interconnessi. Da un punto di vista ambientale, è ben compreso e ragionevole soprattutto nel caso di collegare l’ICT ‘verde’ alla crescita economica. Così, c’è una ragione per cui la sostenibilità diventa un fattore per la rapida crescita del settore ICT; favorisce la crescita economica, assicura un ampio accesso alle nuove tecnologie, e migliora l’efficienza di altri settori.

La definizione di sostenibilità o dei suoi problemi ambientali data nel rapporto delle Nazioni Unite “Our Common Future” dice che sono sostenibili quei processi che “soddisfano i bisogni del presente senza compromettere la capacità delle generazioni future di soddisfare i propri bisogni”.

Essere “verde” nel settore dell’ICT significa in parte prendere soluzioni informate per il modo in cui si utilizzano le risorse naturali.

Una buona illustrazione del termine “sostenibilità” è il modo in cui la vita di oggi può avere un impatto sulla vita delle generazioni future in termini di mancanza di alcune risorse naturali, problemi di salute per coloro che lavorano con la produzione e il riciclaggio, così come l’impatto sulle generazioni future. Quindi, trattando l’ICT ci sono diversi modi per diventare verdi.

È necessario definire le tecnologie “verdi” e il comportamento “verde“. Le tecnologie verdi coinvolgono parti come i server virtuali, permettendo un tasso di utilizzo più elevato per realizzare un risparmio di energia fino all’85%, rispetto ai PC standard. Tuttavia, la tecnologia utilizzata in modo inefficiente non sarà verde. In questo modo, i dipendenti possono avere una grande importanza sulla traccia ambientale. Spegnere l’attrezzatura dopo aver lasciato l’ufficio, e usare la tecnologia per rendere verdi altre parti della vita, come ospitare video conferenze invece di viaggiare, o condividere attrezzature diverse come le stampanti tra i dipartimenti, sono esempi di cuscinetto verde sul posto di lavoro.

Essere ‘verde’ nel settore ICT e nella gestione delle informazioni non è esattamente la stessa cosa che essere ‘verde’ in altri settori. Ogni settore possiede i suoi problemi ambientali e le sue strategie di mitigazione. Il settore dell’ICT è peculiare, in quanto causa del greening di altri settori e non è sicuro come il grande contributo può essere ottenuto per la riduzione delle emissioni e il raggiungimento di un ambiente migliore. Tuttavia, questo impatto ambientale dell’ICT non dovrebbe essere sopravvalutato. Per essere ‘verde’ nel settore dell’ICT è necessario diventare consapevoli del modo di produzione e l’uso e il riciclaggio delle apparecchiature ICT per essere obbligatoriamente sostenibile. Uno degli aspetti più importanti dell’ICT ‘verde’ sono quelli relativi alla conservazione dell’energia e di altre risorse, come la carta e gli elementi rari. Materiali rari e pericolosi sono usati nella produzione di attrezzature ICT. I materiali pericolosi offendono non solo l’ambiente, ma anche le persone che lavorano alla produzione di apparecchiature ICT e al loro riciclaggio. Tutte queste cose sono collegate all’ICT e all’immagazzinamento delle informazioni che hanno il maggiore impatto sull’ambiente. Se tutte le attrezzature sono usate in modo ottimale, è ragionevole diminuire l’impatto sull’ambiente e possibilmente risparmiare le finanze.

  • L’Importanza di essere “verdi”

Al giorno d’oggi essere ‘verde’ è significativo come strategia di business, il che è dovuto in parte alla comprensione del consumatore della protezione ambientale. La gestione ambientale è una parte dell’approccio strategico per diverse aziende di successo, per coinvolgere un nuovo concetto di gestione ‘verde’ per rispondere a questa strategia. Inoltre, investire in innovazioni ‘verdi’ e nella protezione ambientale è vantaggioso per le aziende da un punto di vista finanziario. Essere ‘verde’ potrebbe aumentare il vantaggio competitivo di un’azienda, così come portare nuove opportunità di mercato, e quindi rendere le aziende ‘verdi’ più redditizie.

Allo stesso tempo, i pericoli del cosiddetto ‘green-washing’: “l’attenzione deve spostarsi da un’enfasi sull’immagine a un’enfasi sulla sostanza” sono un serio avvertimento. Così, ‘green-washing’ è il termine assegnato alle aziende che cercano di ottenere la faccia di essere ‘verdi’, ma applicano misure cosmetiche, piuttosto che cambiamenti effettivi nel modo in cui l’organizzazione opera. Quindi, se le organizzazioni vogliono fare un vero cambiamento ‘verde’, possono ottenere un effetto positivo sulla società. Il greening delle organizzazioni può portare nuovi investimenti per migliorare la situazione ambientale, creando posti di lavoro e ricchezza. Si ritiene che gli investimenti in ICT ‘verde’ possano dare un sostegno economico a breve termine.

 

  • Vantaggi di andare in verde

Una possibilità importante per sostenere il greening è la riduzione dei costi. Osservando la tecnologia dell’informazione ‘verde’, diventa chiaro che i centri dati e i server smaltiscono una grande quantità di energia per mantenere il funzionamento e il raffreddamento. Le risorse ICT non possono essere utilizzate nella loro piena capacità (un tasso di utilizzo è di circa il 12,5%). Questa cifra indica la mancanza di efficienza nel settore ICT. Si è scoperto che l’86% delle esigenze può essere organizzato con il 26% dell’attuale utilizzo di energia e questo indica un grande spazio per il miglioramento dei costi. Inoltre, un’altra parte dell’ICT può proporre notevoli opportunità di risparmio nell’uso in modo ecologico. Spegnendo le stampanti, così come altre attrezzature che consumano energia, ogni volta che non vengono utilizzate, si possono risparmiare risorse e ridurre l’impatto ambientale.

Oltre a queste opzioni, si riconosce che muoversi verso una società della conoscenza ‘verde’ richiederà cambiamenti strutturali, suggerendo che i governi dovrebbero aiutare a consentire questo processo, e facendo così si realizzeranno benefici per la società nel suo complesso.

Non esiste una definizione convenzionale di ICT “verde“. Gli argomenti ‘verdi’ potrebbero essere affrontati dalla prospettiva di un ‘problema’ (concentrandosi sulla riduzione delle emissioni) o dalla prospettiva di una ‘soluzione’ (concentrandosi su nuove soluzioni verdi). Questo si riflette nell’approccio all’ICT ‘verde’. Questo approccio è presentato nella Fig. 3. Comprende due segmenti: il greening dell’ICT e il greening con l’ICT.

Figura 3. L’approccio alle ICT “verdi”

Il greening dell’ICT in senso stretto si riferisce alle ICT con un basso carico ambientale, ma l’utilizzo dell’ICT come abilitatore riduce l’impatto ambientale in tutta l’economia al di fuori del settore ICT. La Green ICT, come il greening con l’ICT, è un concetto nuovo e anche i paesi leader e le parti interessate hanno solo circa pochi anni di esperienza. È importante notare che sono necessari sia il tradizionale approccio “problema” che il nuovo approccio “soluzione”. L’inquinamento deve essere regolato e le aziende hanno bisogno di incentivi per affrontare le loro emissioni. Tuttavia, assicurare che la nuova generazione di fornitori di soluzioni ottenga i giusti incentivi è altrettanto importante.

Riduzione del consumo energetico e delle emissioni di gas

Le ICT possono contribuire alla riduzione del consumo energetico e delle emissioni di gas attraverso:

  • Inventando sistemi, tecnologie e dispositivi “intelligenti” innovativi per il risparmio energetico, utilizzando la “gestione intelligente dell’energia”;
  • Applicando politiche di risparmio energetico utilizzando fonti rinnovabili, energia solare e fotovoltaica, energia eolica, biocarburante, tecnologia bioclimatica, tecnologia anti-inquinanti, ecc.
  • Riciclando e riducendo gli sprechi elettronici come vecchi sistemi informatici, chip, PC, hardware, stampanti, telefoni cellulari, ecc.

Circa il 40% del consumo totale di energia è dovuto alle famiglie. Ecco perché sono necessarie “case intelligenti” innovative, costruite con materiali verdi, e un’architettura verde che sfrutti sensori energetici innovativi. In questo contesto, i sistemi ICT possono raggiungere per misurare, gestire e ridurre il consumo di elettricità e i requisiti di condizionamento dell’aria. Nell’ultimo decennio, i produttori di prodotti tecnici e industriali sono stati essenzialmente obbligati a cambiare la direzione del loro consumo energetico, a seguito della crisi economica, oltre alla maggiore consapevolezza ambientale dell’opinione pubblica. La preoccupazione dei produttori è presa dai produttori per la riduzione dell’energia attraverso ogni dispositivo ing8, dai laptop e cellulari ai data center, e avrà presumibilmente successo. I consumatori mostrano la loro preferenza per i dispositivi intelligenti, le nuove tecnologie meno consumanti di energia, le fonti di energia rinnovabile e sistemi di raffreddamento aggiornati e più efficienti con un software di gestione dell’energia migliorato. Questi prodotti sono dotati di certificazione ufficiale per soddisfare o superare le linee guida sull’efficienza.

  • Modi per rendere verdi le ICT

È possibile usare le ICT in un modo che riduce lo stress sull’ambiente rispetto ai modi tradizionali. Questo può essere fatto attraverso nuove tecnologie, tecniche e strategie che permettono il consumo di meno energia e risorse. Una parte importante del lavoro delle ICT è salvare le informazioni. Il bisogno di memorizzazione sta aumentando rapidamente a causa della crescita dell’uso di Internet, delle nuove leggi e regolamenti, dell’organizzazione delle regole per la conservazione delle informazioni e del calcolo scientifico. La parte finale delle informazioni immagazzinate è raccolta nei centri dati. Questi centri dati usano abbastanza energia da spostare parzialmente gli effetti positivi che le ICT possono avere sulla società, per cui si sostiene che “una frazione di risparmio energetico nelle ICT e nelle reti potrebbe portare a significativi risparmi finanziari e di carbonio”. Per raggiungere l’efficienza energetica nell’immagazzinamento delle informazioni, è necessario scegliere hardware con una migliore efficienza energetica o metodi di risparmio energetico per l’uso delle apparecchiature, che sono suggeriti di seguito.

Durante gli ultimi anni, c’è una tendenza di consapevolezza crescente riguardo all’impatto delle società moderne sull’ambiente. Un sacco di fattori importanti per l’ambiente come il consumo di energia o i rifiuti elettronici sono causati dall’applicazione delle ICT, ma allo stesso tempo, questa tecnologia potrebbe anche risolvere alcuni altri problemi ambientali. La doppia natura della questione è affrontata da una prospettiva integrativa con la creazione del concetto di Green Computing. È stato introdotto nel 1992 dall’Agenzia per la protezione dell’ambiente degli Stati Uniti con il programma ‘Energy Star’. All’inizio, è stato applicato su vari prodotti come monitor di computer, televisori e condizionatori d’aria. Il primo risultato ben noto del green computing fu l’opzione di modalità sleep dei monitor di computer che consumano poca energia nel caso in cui l’attività dell’utente venga a mancare dopo un certo periodo. Oggi il green computing raccoglie un sacco di altri concetti come la conferma dell’hardware del computer utilizzando, software di virtualizzazione, cloud computing o, ingrandire l’efficienza energetica dei centri dati. Il Green Computing raccoglie tecnologie che possono contribuire sia a diminuire l’impatto ambientale dell’ICT (‘Green IT’ – greening of ICT) sia ad applicare sistemi di informazione (IS) diminuendo l’impatto ambientale dei materiali di consumo ICT (‘Green IS’ – greening by ICT). Questa visione integrativa combina due approcci complementari, presentati nella Fig. 4.

Figura 4. La visione integrativa per il Green Computing

L’implementazione pratica del Green IT e del Green IS può essere chiarita attraverso i seguenti modelli concettuali di valore.

Green IT: Modello di Valore

Il modello di valore Green IT può contribuire a raggiungere l’obiettivo della sostenibilità ambientale. Questo modello concettuale si basa su quattro elementi, come mostrato nella Fig. 5.

Figura 5. Il modello di valore Green IT

Modello di valore Green IS

Il modello di valore del Green IS è importante per l’accettazione del Green IS e il suo impatto sull’applicazione ambientale dell’azienda. Mentre le aziende sono sottoposte a sospensioni permanenti da diversi regolatori, clienti e concorrenti, alcune di loro sono pronte ad annullare l’efficienza e l’efficacia per le questioni ambientali. Gli investimenti in Green IS per realizzare esperienze di business sostenibili sono destinati ad aumentare il fatturato e/o il reddito.

L’adozione del Green IS da parte del personale di un’azienda (senior manager) è indagata e spiegata attraverso un modello che descrive la percezione come determinata da tre fattori fondamentali. Tre tipi di iniziative strategiche devono essere prese in considerazione per l’adozione degli IS. Tutti loro sono rappresentati nella Fig. 6.

Figura 6. Il modello di valore Green IS

Questo modello potrebbe essere messo in atto attraverso una strategia per l’applicazione di una varietà di tecnologie e tecniche, come video e teleconferenze, sistemi di gestione delle emissioni, ecc.

Un quadro per la gestione e l’applicazione di Green IT e Green IS può essere stabilito che comprenda una varietà di tecnologie che offrono opportunità per ridurre gli impatti ambientali negativi nelle attività di produttori e consumatori che usano ICT. Tra queste tecnologie verdi ci sono le seguenti.

Cloud computing

Molte organizzazioni applicano un nuovo paradigma informatico, il cloud computing, per ottimizzare l’uso e minimizzare il costo dei loro server. In questo modo, i costi precedenti legati alla creazione di infrastrutture informatiche vengono omessi. Il cloud computing permette di collegare l’infrastruttura condivisa e bilanciare le risorse IT per i compiti di calcolo in tempo reale, riducendo le emissioni di gas e mantenendo i livelli di servizio. Il cloud computing si basa sulla condivisione di risorse hardware e software che sono condivise da più utenti e riallocate dinamicamente in base alla domanda. Questa tecnologia “verde” elimina in definitiva la necessità per un’azienda di avere un centro dati in loco, il che ha un effetto positivo sull’ambiente naturale e le sue risorse. Ad oggi, molti venditori forniscono servizi cloud incentrati sul Green IS e stanno sperimentando significativi tassi di crescita finanziaria per annum.

Gestione dell’energia del computer

Per risparmiare energia nell’informatica, un’azione comune è lo spegnimento dell’attrezzatura quando non è in funzione. Esiste un cosiddetto standard industriale aperto “Advanced Configuration and Power Interface” (ACPI 2) che rappresenta una pratica avanzata di Green IT. Permette il controllo diretto dell’alimentazione del sistema operativo del computer e del suo hardware sottostante. Questo standard esclude automaticamente componenti come monitor e dischi rigidi quando il periodo di inattività dell’attrezzatura ha luogo. Il dispositivo di risparmio energetico del computer include diverse modalità di sospensione del monitor, del disco rigido, dello standby di sistema e dell’ibernazione, e diversi stati di alimentazione della CPU.

Progettazione del data center

I data center consumano una grande percentuale di energia, più di 100 volte rispetto agli edifici commerciali standard. Quindi, la progettazione efficiente del riciclaggio energetico dei data center, come il riciclaggio del calore residuo, dà un notevole impatto positivo sulla sicurezza energetica e può essere utilizzato nelle seguenti aree:

  • Sistemi IT: aumentare l’utilizzo dell’hardware (attraverso la virtualizzazione, vedi sotto); consentire modalità di risparmio energetico del computer; acquistare strumenti efficaci dal punto di cambio (ad esempio, alimentatori per computer, processori di computer, dispositivi di archiviazione allo stato solido, server terminal);
  • Principali sistemi di alimentazione: parti di gestione dell’alimentazione (dispositivi hardware e software per l’ottimizzazione del lavoro e dell’alimentazione); aumentare l’uso di energia rinnovabile; uso della luce naturale al posto dell’elettricità;
  • Sistemi di raffreddamento;
  • Gestione dell’aria.

Virtualizzazione IT

La virtualizzazione IT si riferisce alla separazione delle risorse IT tramite la virtualizzazione dei server e la virtualizzazione dello storage. Virtualizzazione del server significa funzionamento di molti sistemi informatici logici su un unico hardware fisico, e la virtualizzazione dello storage significa sommare l’archiviazione fisica da molti strumenti di memoria di rete, su cui inserire un singolo dispositivo di archiviazione gestito da una console centrale. La virtualizzazione IT riduce i costi per l’hardware, riduce il consumo energetico e l’uso dello spazio fisico. Allo stesso tempo, affina i test e la diffusione del software e aumenta la versatilità degli investimenti hardware. Inoltre, può aiutare nella condivisione del lavoro: i server sono occupati o messi in uno stato di sospensione a basso consumo. Pertanto, la virtualizzazione è uno dei principali approcci per le organizzazioni per implementare la sostenibilità ambientale nelle pratiche IT e nel business.

Riciclaggio dei materiali e rifiuti elettronici

Esplorando il corretto riciclaggio delle tecniche IT, i rifiuti elettronici vengono ridotti e gli elementi nocivi come il piombo, il mercurio e il cadmio vengono scartati dall’ambiente naturale. Poi possono essere riutilizzati e la produzione de novo potrebbe essere omessa. Il processo di riciclaggio dei materiali è fattibile quasi per qualsiasi dispositivo informatico e accessorio, come dischi rigidi, cartucce di stampanti e batterie. In questo modo, le persone e le organizzazioni commerciali possono estendere la vita delle attrezzature informatiche aggiornando gli strumenti invece di cambiarli semplicemente.

Smart grid e questioni intelligenti

La tecnologia Smart Grid comprende hardware e software che assicurano uno sfruttamento più efficace delle infrastrutture attuali per la generazione di elettricità, la sua trasmissione e distribuzione. Si tratta di una versione aggiornata del sistema di consegna dell’elettricità, che agisce automaticamente sui flussi di informazioni. Il compito è quello di rendere migliore l’efficacia, la sicurezza e la sostenibilità della produzione e della diffusione dell’elettricità attraverso il bilanciamento del carico e la gestione dei picchi di carico. I dispositivi della rete possiedono sensori per raccogliere dati (contatori di potenza, sensori di tensione, rilevatori di guasti, ecc.) Un dispositivo di questo tipo è lo Smart Meter, che fa uso della comunicazione digitale tra i dispositivi collegati alla rete. I dati raccolti riguardano i comportamenti di produzione e consumo di energia sia dei fornitori che dei consumatori. In questo senso, lo scambio di informazioni in tempo reale tra produttori e consumatori aiuta a controllare meglio le richieste di energia e riduce la necessità di un surplus di energia durante le ore di punta. Gli strumenti sulla rete hanno sensori per raccogliere dati (contatori di potenza, sensori di tensione, rilevatori di guasti, ecc.) Essi leggono il consumo di energia (elettricità, gas, ecc.) in periodi definiti e quotidianamente inviano i dati al servizio pubblico, ad esempio, per il monitoraggio e la stima dei costi. Possono anche essere utilizzati per fornire informazioni sul consumo di energia e per fissare i prezzi dell’energia in tempo reale ai consumatori. Una caratteristica chiave è la tecnologia di automazione che permette al servizio pubblico di regolare e controllare ogni dispositivo da una posizione centrale. I benefici includono la gestione di fonti alternative di elettricità (per esempio, l’energia solare ed eolica), il controllo intelligente per edifici ecologici, e a tempo debito l’integrazione di veicoli elettrici nella rete.

Le future tendenze ICT: dal verde alla strategia

Nell’ambito del settore ICT, ci sono due segmenti principali:

  • L’infrastruttura di telecomunicazione, cioè le reti di telecomunicazione composte da stazioni di base e punti di accesso che forniscono connettività ai dispositivi (centrati sull’uomo o sulla macchina);
  • Dispositivi mobili/terminali, che comunicano collegandosi all’infrastruttura (per esempio, telefoni cellulari, tablet, sensori, attuatori, veicoli, droni, ecc.)

In futuro, miliardi di dispositivi/terminali saranno collegati a milioni di stazioni base.

Sebbene entrambi i segmenti (infrastruttura di rete e dispositivi/terminali) trarrebbero vantaggio dalle energie rinnovabili, il ruolo delle energie rinnovabili è molto maggiore nel segmento di rete per i seguenti motivi:

  • Il consumo energetico delle stazioni base (infrastruttura di telecomunicazione) è molto maggiore del consumo energetico di dispositivi/terminali;
  • La copertura globale delle reti è importante per realizzare la società in rete immaginata e l’Internet delle cose;
  • Le stazioni base hanno dimensioni maggiori e sono costose. È conveniente integrare un sistema di energia rinnovabile con ogni stazione base.
  • Le stazioni base necessitano di una fornitura di energia affidabile e continua a differenza dei dispositivi (ad esempio, telefoni cellulari) che possono essere caricati ogni volta che è disponibile energia.

Per comprendere le future tendenze green delle ICT, è importante comprendere non solo la storia del verde ma anche la storia delle ICT. Negli ultimi 20-30 anni è stata costruita l’infrastruttura ICT, le prestazioni e la densità continueranno a migliorare e aumentare. Tuttavia, è stata raggiunta una svolta. La soglia attuale è simile alla svolta che tutte le epoche industriali hanno vissuto. Durante la fase di installazione, vengono utilizzate nuove soluzioni per aumentare l’efficienza del vecchio sistema, durante la fase di implementazione il nuovo sistema raggiunge la maturità, consentendogli di fornire soluzioni completamente nuove. Inizialmente, la trasformazione è avvenuta nei “settori dell’informazione”, ad esempio nei settori della musica, del video o del libro, ecc., e ora iniziamo a vedere i primi segni di un serio cambiamento nei “settori pesanti”, come l’auto e la mobilità, l’edilizia, l’agricoltura e il commercio al dettaglio, nonché nei modelli di business di base.

Il passaggio dal miglioramento dei sistemi esistenti alla fornitura di nuove soluzioni è supportato da due tendenze dello sviluppo delle ICT e delle ICT “verdi” che sono importanti da comprendere.

  • (1) le società ICT sono ora attori economici influenti. Per la prima volta nella storia, un’azienda ICT – Apple – è stata la più grande azienda negli Stati Uniti. Apple ha superato Exxon Mobile, dimostrando che le aziende ICT non possono più essere ignorate dalle politiche di mercato-.
  • (2) le società ICT fanno ora parte di una rete onnipresente che collega quasi tutti e quasi tutto il pianeta. Al giorno d’oggi, più persone sono connesse che in qualsiasi altro momento della storia umana. Entro il 2020, ci sono circa 50 miliardi di dispositivi connessi e la società sta ottenendo l’accesso ai dati e sperimenta una trasparenza fondamentalmente diversa da quella che qualsiasi società abbia mai sperimentato prima.

Una delle principali sfide è che le nuove soluzioni ICT “verdi” devono competere in un contesto normativo che comprenda le normative create per la struttura industriale del XIX secolo. Deve anche affrontare le predisposizioni tra persone che non hanno familiarità con il rapido sviluppo di soluzioni ICT. In effetti, l’attuale sviluppo tecnologico è così rapido che i membri della società di qualsiasi tipo – dai politici ai leader aziendali, agli esperti economici stanno assistendo a come l’intera procedura – da un’idea all’attuazione su larga scala, si svolge solo da pochi decenni. Per chiarire la situazione, è necessario studiare le fasi di una soluzione dirompente a lungo termine. All’inizio, qualcosa innesca un’idea che diffonde, ad esempio, i primi personal computer. Ciò ha portato a idee prossime, come uffici senza carta, riunioni virtuali, ecc. Tutte queste attività hanno entusiasmato le persone. Dopo un po ‘, furono introdotti prototipi funzionanti e molte aziende investì in prototipi molto costosi di apparecchiature di videoconferenza. La tecnologia era troppo nuova e non è stato utilizzato alcun modello di business praticabile, invece, questi prototipi sono stati rami e gestiti dalle aziende stesse. Progressivamente, molti decisori erano stati entusiasti dell’idea delle ICT come forza dirompente in diversi settori, che alla fine pensavano che non sarebbe mai accaduto.

Una tendenza oggi è che i responsabili politici non considerano cambiamenti significativi che saranno apportate dalle ICT “verdi“. Molti hanno ancora in programma di investire in nuove centrali a carbone perché utilizzano lo stesso modello economico utilizzato in precedenza. Ad esempio, Siemens Germania ha annunciato di sostenere un obiettivo del 25 per cento per le energie rinnovabili e di porre fine alla propria attività nel settore dell’energia nucleare.

Conclusioni

La storia dello sviluppo delle ICT dimostra che la società si trova ora in un punto di flessione in cui le soluzioni ICT si muovono verso la creazione di nuove soluzioni invece di migliorare i vecchi sistemi. Si potrebbero sottolineare due importanti tendenze relative allo sviluppo delle TIC:

  • (1) Il fatto che le imprese ICT siano ora economicamente potenti e funa da fonte di capitale sia economico che politico.
  • (2) Le soluzioni e le imprese ICT sono ora così abbondanti che possono emergere nuovi cluster di fornitori di soluzioni. È importante capire cosa possono effettivamente fornire le soluzioni ICT.

Le ICT “verdi” includono l’uso di soluzioni ICT a sostegno della crescita intelligente. Di conseguenza, per osservare le ICT “verdi“, dovrebbe essere compreso il contesto delle attuali tendenze “verdi” delle ICT. Mentre fino al 21° secolo, il “verde” era visto come conservazione della natura o controllo dell’inquinamento, all’inizio degli anni 2000 si è avuto un cambiamento significativo. Un focus spostato da una prospettiva di problema (controllo dell’inquinamento) a una prospettiva di soluzione e una nuova generazione di leader aziendali ha visto l’opportunità di collegare la necessità di efficienza delle risorse e vendite di nuovi prodotti e servizi.

Uno spostamento parallelo si osserva nello sviluppo delle ICT. Si passa dal miglioramento dei sistemi esistenti alla fornitura di nuove soluzioni. Sono state create nuove soluzioni ICT per sostenere l’efficienza energetica e la crescita “verde”.  Uno degli esempi più popolari per le soluzioni basate sulle ICT sono gli e-book, le reti intelligenti, le auto elettriche, le riunioni online, ecc.

È positivo che molti cittadini abbiano iniziato a realizzare il concetto di cambiamento climatico causato dall’uomo e l’esaurimento delle risorse. Essi ritengono inoltre che l’assoluta necessità di agire in materia. Questa comprensione ha portato molte persone a modificare il loro stile di vita personale. La tendenza A “vivere verde” comprende molti aspetti come le costruzioni verdi, l’uso di energia rinnovabile, il risparmio energetico a casa, l’uso prolungato di prodotti eco-compatibili, un approccio di riciclaggio. Qui per aggiungere ci sono le cosiddette liste di controllo per la sostenibilità, progettate per aiutare le famiglie a valutare quanto siano sostenibili e per offrire suggerimenti per aumentare la sostenibilità domestica. Inoltre, un uso intelligente dei servizi e può essere uno strumento per un minor consumo energetico nella vita di tutti i giorni e sul lavoro. Ad esempio, questo è il caso dell’uso della carta: la corrispondenza odierna è sostituita da formati digitali che utilizzano Internet e dispositivi intelligenti. La produzione e la distribuzione di nuovi prodotti e servizi mostrano la tendenza alla minimizzazione dell’energia necessaria, stimata in base all’impronta di carbonio. Un altro esempio è la sostituzione delle conferenze tradizionali con quelle online che impongono un effetto positivo diretto sulla protezione ambientale e sulla riduzione delle emissioni di gas a effetto serra a causa della riduzione dei servizi di trasporto. Si dice che le teleconferenze possano evitare la produzione di circa 540.000 tn di CO2  all’anno; questo è il costo del trasporto aereo di persone.

L’uso di strumenti e servizi ICT ” verdi” attraverso Internet a banda larga/5G contribuisce al benessere ambientale e sociale con la diminuzione dei costi e dei tempi di accesso agli uffici governativi (servizi 24 ore su 24, 7 giorni su 7), il risparmio energetico (nessun trasporto) e la limitazione delle emissioni inquinanti (impronta di carbonio). Allo stesso modo, nel settore dell’e-commerce e dell’e-business nuove soluzioni di business innovative sono a favore dell’imprenditore o del cliente finale.

Test: LO4 Livello basale

Referenze

Risorse scientifiche ad accesso aperto: banche dati digitali

LIVELLO BASE

Un open access o OA è un insieme di principi e una serie di pratiche attraverso le quali i risultati della ricerca sono distribuiti online, senza costi o altre barriere di accesso.

Sommario

 

Risorse scientifiche ad accesso aperto

Introduzione alle risorse «Open Access»

Un open access o OA è un insieme di principi e una serie di pratiche attraverso le quali i risultati della ricerca sono distribuiti online, senza costi o altre barriere di accesso. Con l’accesso aperto in senso stretto (secondo la definizione del 2001), o libre open access, le barriere alla copia o al riutilizzo sono anche ridotte o rimosse applicando una licenza aperta per il copyright.

L’obiettivo principale del movimento dell’accesso aperto è la “letteratura di ricerca peer-reviewed”. Storicamente, questo si è concentrato principalmente sulle riviste accademiche a stampa. Mentre le riviste convenzionali (non ad accesso aperto) coprono i costi di pubblicazione attraverso pedaggi di accesso, come abbonamenti, licenze di sito o tariffe pay-per-view, le riviste ad accesso aperto sono caratterizzate da modelli di finanziamento che non richiedono al lettore di pagare per leggere i contenuti della rivista. L’accesso aperto può essere applicato a tutte le forme di risultati di ricerca pubblicati, compresi gli articoli di riviste accademiche peer-reviewed e non peer-reviewed, articoli di conferenze, tesi, capitoli di libri, monografie e immagini.

Tuttavia, quando si tratta di definire l’accesso “free”, si deve distinguere “gratis” da “libre”.

Al fine di riflettere le differenze del mondo reale nel grado di accesso aperto, la distinzione tra accesso aperto gratuito e accesso aperto libre è stata aggiunta nel 2006 da Peter Suber e Stevan Harnad, due dei co-designer della definizione originale di Budapest Open Access Initiative (BOAI) di pubblicazione ad accesso aperto. Gratis open access si riferisce all’open accesso gratuito e open access libre si riferisce all’accesso online gratuito più alcuni diritti di riutilizzo aggiuntivi. L’open access libre è equivalente alla definizione di accesso aperto nel BOAI, la Dichiarazione di Bethesda sulla pubblicazione ad accesso aperto e la Dichiarazione di Berlino sull’accesso aperto alla conoscenza nelle scienze e negli studi umanistici. I diritti di riutilizzo del libre OA sono spesso specificati da varie licenze Creative Commons specifiche; queste richiedono quasi tutte l’attribuzione della paternità agli autori originali.

Il documento rilasciato nel febbraio 2002 dal BOAI contiene la seguente definizione molto usata:

– Con “open access” a questa letteratura, intendiamo la sua libera disponibilità su Internet pubblica, permettendo a qualsiasi utente di leggere, scaricare, copiare, distribuire, stampare, cercare o collegare i testi completi di questi articoli, strisciarli per l’indicizzazione, passarli come dati al software, o usarli per qualsiasi altro scopo legale, senza barriere finanziarie, legali o tecniche diverse da quelle inseparabili dall’accesso a Internet stesso. L’unico vincolo alla riproduzione e alla distribuzione e l’unico ruolo del diritto d’autore in questo campo, dovrebbe essere quello di dare agli autori il controllo dell’integrità del loro lavoro e il diritto di essere adeguatamente riconosciuti e citati.

Alla luce delle informazioni di cui sopra, l’uso di risorse scientifiche open source deve seguire le regole comunemente adottate. La pubblicazione di risorse scientifiche open source deve anche menzionare chiaramente se sono libre o gratuite e devono essere attribuite all’autore originale.

Introduzione ai dati (livello base)

Cosa sono i “dati”

Secondo il dizionario Merriam-Webster, ci sono tre diverse definizioni di dati:

  1. Informazioni fattuali, come misurazioni o statistiche, utilizzate come base per il ragionamento, la discussione o il calcolo
  2. Informazioni in forma digitale che possono essere trasmesse o elaborate
  3. L’output di informazioni da parte di un dispositivo o di un organo di rilevamento che include informazioni utili e irrilevanti o ridondanti e deve essere elaborato per essere significativo

In questo documento copriremo la maggior parte delle tre definizioni.

Breve storia dei dati

Da quando gli esseri umani hanno iniziato a comunicare, hanno sperimentato la necessità di conservare le informazioni a lungo termine. Conservare le informazioni era necessario ai nostri antenati per garantire la loro sopravvivenza. Trasmettere informazioni attraverso le generazioni permetteva loro di tenere traccia dei potenziali pericoli, ma anche di avere un inventario dei posti migliori per raccogliere il cibo, i punti migliori per la pesca, gli animali più interessanti da cacciare e dove trovare i migliori rifugi. Tutte queste informazioni venivano trasmesse oralmente. Con l’evoluzione della conoscenza e l’invenzione della scrittura, hanno cominciato a memorizzare le informazioni su supporti indelebili.

Senza entrare nel dettaglio dell’evoluzione della rappresentazione delle informazioni, verranno forniti alcuni esempi significativi che hanno aiutato nella strutturazione del pensiero, che hanno portato alla scoperta degli strumenti informatici che usiamo quotidianamente.

Dati prima dell’invenzione dei computer

Man mano che le società umane emergevano, le motivazioni collettive per lo sviluppo della scrittura erano guidate da esigenze pragmatiche. Questi includono società di organizzazione e di governo attraverso la formazione di sistemi giuridici, contratti, atti di proprietà, tassazione, accordi commerciali, trattati, registri censuari, conservazione della storia, mantenimento della cultura, tenere traccia scoperte scientifiche, codificando le conoscenze attraverso curricula ed elenchi di testi che sono artisticamente eccezionale o ritenuto contenere fondamento conoscenza, e molte altre esigenze.

Figura 1: Scrittura cuneiforme

Ad esempio, intorno al 4 ° millennio a.C., la complessità del commercio e dell’amministrazione in Mesopotamia ha superato la memoria umana, e la scrittura è diventata un metodo più affidabile per registrare e presentare le transazioni in una forma permanente.

Il cuneiforme fu uno dei primi sistemi di scrittura, inventato dai Sumeri nell’antica Mesopotamia. Si distingue per i suoi segni a forma di cuneo su tavolette di argilla, realizzati per mezzo di una ape smussata per uno stilo, come dimostrato in Fig. 1.

Nel corso del tempo, lo sviluppo della conoscenza, la moltiplicazione delle informazioni, la limitazione della memoria umana, la necessità di scrivere e tenere traccia di enormi quantità di informazioni è diventato essenziale. Tuttavia, nonostante abbia tenuto traccia di quasi tutti i tipi di informazioni o dati su vari supporti, è diventato sempre più complesso recuperarli in modo semplice. Bisognava leggere decine di rapporti e libri per poter sintetizzare su un argomento.

Dati nell’era moderna

Oggi, la quantità di dati prodotti ogni anno e conservati digitalmente, ad esempio, liste di cose da fare, ricette, promemoria, giornali di bordo, mappe, foto, e-mail, dati scientifici, rapporti politici, video, ecc. è così esponenziale da creare la necessità di strutturare il modo in cui possiamo recuperare queste quantità fenomenali.

I computer hanno guadagnato popolarità e sono diventati convenienti da usare per gli individui e le aziende private nei primi anni ’80. Tuttavia, gli anni 60 possono essere considerati come la nuova era nel campo dei database. L’introduzione del termine “database” coincise con la disponibilità dello stoccaggio ad accesso diretto o DAS, dalla metà degli anni 60 in poi. Questa nuova tecnologia rappresentava un contrasto con le passate schede perforate e i sistemi basati su nastro, permettendo un uso interattivo condiviso piuttosto che l’elaborazione quotidiana in batch. Furono sviluppati due modelli di dati principali – il modello di rete “CODASYL” (Conference on Data System Language) e il modello gerarchico “IMS” (Information Management System).

La prima generazione di sistemi di database era “navigazionale, in opposizione all’accesso sequenziale dovuto alle precedenti tecnologie usate per memorizzare i dati, cioè nastri e schede perforate. Le applicazioni tipicamente accedevano ai dati seguendo i puntatori da un record all’altro. I dettagli di memorizzazione dipendevano dal tipo di dati da memorizzare.

L’aggiunta di un campo extra a un database richiedeva la riscrittura dello schema di accesso/modifica sottostante. L’enfasi era sui record da elaborare, non sulla struttura generale del sistema. Un utente avrebbe bisogno di conoscere la struttura fisica del database per interrogare le informazioni. Un database che si dimostrò essere un successo commerciale fu il sistema “SABRE” che fu usato da IBM per aiutare American Airlines a gestire i suoi dati di prenotazione. Questo sistema è ancora utilizzato dai maggiori servizi di viaggio per i loro sistemi di prenotazione.

Nella moderna tecnologia dell’informazione, c’è sempre stata confusione tra gli utenti tra i database e i motori di ricerca web a cui si accede tramite browser. Un database di solito contiene dati strutturati, in contrasto con il World Wide Web (www), che di solito contiene dati non strutturati. Anche se il recupero di informazioni da entrambi i database e “www” sono senza soluzione di continuità e sembrano simili, il contenuto e il modo in cui le query sono affrontate sono completamente diversi. I dati strutturati e non strutturati saranno spiegati più avanti in questo documento.

Comprendere il vocabolario di base

Terminologia

Come ogni altra scienza, l’informatica ha un proprio linguaggio. Per comprendere appieno le informazioni che verranno fornite in questo documento, è essenziale acquisire familiarità con il vocabolario relativo a questo argomento.
Inoltre, la comunicazione con un DBA (Database Administrator) sarà facilitata. Quando un Biochimico dovrà esprimere le sue esigenze in termini di strutturazione o gestione dei dati in un Database, sarà tentato di usare il suo linguaggio tecnico. Allora il DBA dovrà capire la richiesta e trasformarla in un linguaggio informatico, che sarà comprensibile ai biochimici.

Cosa sono i “Dati” nell’era del computer

Figura 2:Un bit può essere 0 o 1

Come menzionato nella sezione 2.1, a seconda del dominio a cui ci si riferisce, i dati possono avere significati diversi. Nel caso dell’informatica e dei database, i dati sono definiti come qualsiasi sequenza di uno o più simboli. I dati richiedono un’interpretazione per diventare informazioni. Nell’informatica il “bit” è la più piccola quantità di dati. Un bit è binario. I numeri binari sono una rappresentazione dei numeri che usa solo due cifre, 0 e 1 (Fig. 2). È un sistema numerico in base 2, cioè:

  • 0 0 0 1 = valore numerico 20
  • 0 0 1 0 = valore numerico 21
  • 0 1 0 0 = valore numerico 22
  • 1 0 0 0 = valore numerico 23

Tabella 1

Una sequenza di “bit” costituisce un “Byte”. I byte sono composti da un multiplo di 4 bit (un byte di 4 bit è chiamato Nibble) come nell’esempio precedente. Oggi, il byte è un’unità di informazione digitale che consiste più comunemente in otto bit. Storicamente, il byte era il numero di bit usato per codificare un singolo carattere di testo in un computer. Con un byte di otto bit il numero decimale massimo è 256. Storicamente, il byte è anche l’unità di informazione del computer o la capacità di immagazzinamento dati usata per misurare la quantità di dati (Tabella 1).

Tabella 2: ASCII Tabella

Un esempio di utilizzo è la tabella ASCII (American Standard Code for Information Interchange) dei caratteri comunemente utilizzati per i caratteri alfabetici (Tabella 2). I primi 32 caratteri sono denominati caratteri di controllo. Inizialmente, essi non erano progettati per rappresentare informazioni stampabili, ma per controllare i dispositivi che utilizzano codice ASCII, ad esempio le stampanti, o per fornire meta-informazioni sui flussi di dati, ad esempio quelli memorizzati su nastro magnetico.

Che cos’è “Metadati”

Figura 3: Foto scattata in Grecia

I metadati, o, in parole povere, le meta-informazioni, servono a referenziare i dati sui dati. Avere dei dati non è sufficiente per metterli semplicemente online. I dati non sono utilizzabili finché non possono essere spiegati in un modo che sia l’uomo che il computer possono elaborare.

I metadati possono essere impliciti, specificati o forniti. Esso comprende data relativi a eventi fisici, o processi, e avrà anche una componente temporale. In quasi tutti i casi questa componente temporale è implicita. esso Può essere leggermente difficile capire, tuttavia Di seguito sono riportato i seguenti esempio fornirà una spiegazione più chiara di questo termine.

Figura 4:
Metadati dell’immagine

Immaginate di essere in viaggio con il vostro smartphone preferito in qualche isola paradisiaca. Iniziate a scattare delle foto (Fig. 3) per conservare un bel ricordo del vostro viaggio. Una settimana dopo, il vostro viaggio arriva alla fine e dovete tornare a casa.

Tornato a casa, inviti i tuoi migliori amici per una festa e vuoi condividere con loro le bellezze che hai visto durante il tuo viaggio. Iniziate a mostrare le foto, ma non riuscite a ricordare quale giorno, a che ora e dove sono state scattate alcune di esse. È qui che i metadati delle foto possono aiutare. In poche parole, è la descrizione dei dati. In questo esempio, l’immagine è il dato e la descrizione dell’immagine è il metadato (Fig. 4).

Nella biotecnologia, bisogna capire che i metadati sono di gran lunga più importanti dei dati. È molto semplice capire il motivo per cui i metadati sono un componente cruciale direttamente correlata ai dati. Immaginate un esperimento che porterà a un risultato specifico. Questo esperimento, per essere valido, deve essere documentato. Questa documentazione deve includere tutte le condizioni in cui è stato condotto l’esperimento.  Ciò potrebbe includere la descrizione del tipo di materia prima utilizzata, la sua fonte, in quali condizioni è stata raccolta, i tipi di macchine per elaborare l’esperimento, la temperatura, la data, l’ora, ecc. Affinché il risultato di questo esperimento sia paragonabile ad altri risultati di esperimenti simili, tutte le condizioni devono essere simili. I dati grezzi senza metadati sono inutili.

La sfida più grande nel Biotech, e in qualsiasi altra scienza, è standardizzare i metadati. Nella maggior parte delle banche dati biotech, questo non è rispettato. Bisogna essere assolutamente consapevoli di questo fenomeno e rispettare pienamente le norme.

Che cos’è un “Database”

Figura 5: Struttura parziale del database

In generale, un database è definito come una collezione di dati, come elenchi telefonici, liste di prezzi, liste di inventario, indirizzi di clienti, ecc. Tuttavia, in termini tecnici, un database è definito come “una collezione auto-descrittiva di record integrati”. Implica una tecnologia informatica, completata da un linguaggio informatico specifico, come SQL (Structured Query Language).

Un database è composto da più tabelle (Fig. 5) e da dati e metadati. I metadati sono i dati che descrivono la struttura dei dati all’interno di un database. Se sapete come sono disposti i vostri dati, allora potete recuperarli. Dato che il database contiene una descrizione della propria struttura, viene definito auto-descrittivo. Il database è integrato perché include non solo i dati ma anche le relazioni tra di essi.

Il database memorizza i metadati in un’area chiamata dizionario dei dati, che descrive le tabelle, le colonne, gli indici, i vincoli e altri elementi che compongono il database.

Poiché un sistema di file piatto, cioè “Spreadsheet”, non ha metadati, le applicazioni scritte per lavorare con i file piatti devono contenere l’equivalente dei metadati come parte del programma dell’applicazione.

Cosa sono le “Tabelle” in un database

Una tabella è una raccolta di dati correlati in un formato di tabella composto da colonne e righe all’interno di un database. Assomiglia a un foglio di calcolo (Fig. 6).

Cosa sono le “Colonne” in un database

Figura 6: Tabella con righe e colonne

Una colonna è un insieme di valori di dati, tutti di un unico tipo, in una tabella. Le colonne definiscono i dati in una tabella. La maggior parte dei database permette alle colonne di contenere dati complessi come immagini, interi documenti o anche video clip. Quindi, una colonna che permette valori di dati di un solo tipo non significa necessariamente che abbia solo valori di testo semplici. Alcuni database vanno anche oltre e permettono ai dati di essere memorizzati come file sul sistema operativo, mentre i dati della colonna contengono solo un puntatore o un link al file effettivo. Questo è fatto allo scopo di mantenere la dimensione complessiva del database gestibile – una dimensione minore del database significa meno tempo per i backup e meno tempo richiesto per cercare i dati all’interno del database.

In una tabella a ogni colonna vengono in genere assegnati un tipo di dati e altri vincoli, che determinano il tipo di valore che può essere archiviato in tale colonna. Ad esempio, una colonna potrebbe accettare indirizzi di posta elettronica e un’altra potrebbe accettare numeri di telefono con un vincolo di 10 cifre.

Che cos’è un “Record”

Un record è una rappresentazione di un oggetto fisico o concettuale. Diciamo, per esempio, che si vuole tenere traccia dei clienti di un’azienda. Si assegna un record per ogni cliente. Ogni record ha più attributi, come nome, indirizzo e numero di telefono. I singoli nomi, indirizzi e così via sono i dati.

Che cosa sono gli “Indici”

Figura 7: Esempio di indice

I dati strutturati sono memorizzati sotto forma di record in un database. Ogni record ha un campo chiave, che lo aiuta ad essere riconosciuto in modo univoco, cioè l’ID di un paziente. Nessun altro paziente può avere lo stesso numero ID, ma un altro paziente può avere lo stesso nome e cognome.

L’indicizzazione di un database è una tecnica per recuperare in modo efficiente i record dai file del database, sulla base di alcuni attributi sui quali è stata eseguita l’indicizzazione. Per farla semplice, l’indicizzazione nei sistemi di database è simile a quella che vediamo di solito nei libri. All’inizio o alla fine di un libro, si può trovare un indice (che è diverso da un indice), che fornisce tutti i numeri di pagina per un argomento specifico. Per esempio, un atlante può essere diviso in capitoli contenenti mappe, capitoli contenenti dati sulla popolazione e capitoli dedicati alla produzione dei paesi o ai dati agricoli. Se state cercando un paese specifico e volete avere una visione d’insieme di tutti i dati riguardanti questo paese specifico, l’indice potrebbe essere molto utile perché vi mostrerà la pagina relativa a quel paese in ogni capitolo (Fig. 7).

Che cos’è un “oggetto”

In informatica, un oggetto può essere una variabile, una struttura di dati, una funzione o un metodo e, come tale, è un valore in memoria referenziato da un identificatore. Nel modello relazionale di gestione dei database, un oggetto può essere una tabella o una colonna, o un’associazione tra i dati e un’entità del database, come la relazione tra l’età di una persona e una persona specifica.

Structured data

Figura 8: Dati strutturati

Secondo la SNIA (Storage Networking Industry association), i dati strutturati sono definiti come:

“I dati che sono organizzati e formattati in un modo noto e fisso.

Il formato e l’organizzazione sono solitamente definiti in uno schema. Il termine dati strutturati è di solito inteso come dati generati e mantenuti da database e applicazioni aziendali”.

Tre condizioni sono necessarie per descrivere i dati come strutturati:

Devono essere conformi a un modello di dati,

Deve avere una struttura ben definita,

Deve seguire un ordine coerente e può essere facilmente accessibile e utilizzato da una persona o da un programma informatico.

I dati strutturati sono di solito memorizzati in schemi ben definiti come i database. È generalmente tabulare con colonne e righe che definiscono chiaramente i suoi attributi (Fig. 8).

SQL (Structured Query language) è spesso usato per gestire i dati strutturati memorizzati nei database.

Dati destrutturati

Figura 9: Estrazione di un file PDF

Le informazioni che non sono organizzate in un modello predefinito sono chiamate dati non strutturati o informazioni non strutturate. In informatica, file come file di testo, foto, file video, file audio e presentazioni sono considerati file non strutturati. Tipicamente, un file PDF contiene dati non strutturati (Fig. 9).

Si stima che l’80-90% del totale dei dati dematerializzati nel mondo sia non strutturato. I soliti algoritmi di interrogazione non sono in grado di estrarre in modo semplice ed efficiente le informazioni richieste da un file non strutturato, come nell’esempio della Fig. 9. Le stesse informazioni contenute nella Fig. 9 possono essere facilmente recuperate con una query. Tuttavia, oggi sono disponibili strumenti di analisi dei dati non strutturati alimentati dall’intelligenza artificiale (AI), che sono stati creati appositamente per accedere alle intuizioni disponibili dai dati non strutturati (vedi 3.1.12 Analytics).

Big data

Secondo SNIA (Storage Networking Industry association), i big data sono definiti come:

“Una caratterizzazione di set di dati troppo grandi per essere elaborati in modo efficiente nella loro interezza dalle piattaforme computazionali standard più potenti disponibili.”

In altre parole, i Big Data si riferiscono a enormi quantità di dati strutturati o non strutturati che non possono essere elaborati dal solito software come linguaggio di query di database tradizionale o qualsiasi altro tipo di motore di recupero.

Esiste confusione sull’uso corrente dei termini Big Data e Analytics. I Big Data sono le informazioni, mentre Analytics è il modo per estrarre le informazioni desiderate da enormi quantità di informazioni disponibili.

Analytics

Nella tecnologia informatica, Analytics è un metodo per estrarre valore dai grandi dati.

Nel campo dell’assistenza sanitaria, Big Data Analytics ha portato a molti miglioramenti fornendo medicina personalizzata e analisi predittiva. Poiché il volume dei dati sta aumentando drammaticamente, i database tradizionali e i motori di ricerca non sono in grado di gestire e recuperare informazioni specifiche. I dati dei pazienti sono generati da risonanze magnetiche, raggi X, macchine per gli esami del sangue, sensori di monitoraggio e molte altre fonti di dati complessi da elaborare. Molte informazioni nell’assistenza sanitaria sono ora in forma elettronica; si inserisce sotto l’ombrello dei big data in quanto la maggior parte di esse non è strutturata e difficile da usare.

I big data nella ricerca sanitaria sono particolarmente promettenti in termini di ricerca biomedica esplorativa, poiché l’analisi guidata dai dati può procedere più rapidamente della ricerca guidata dalle ipotesi. Successivamente, le tendenze viste nell’analisi dei dati possono essere testate nella ricerca biologica tradizionale, guidata da ipotesi, ed eventualmente nella ricerca clinica.

Archivio

Un archivio di dati o data warehouse è un luogo centralizzato per memorizzare e mantenere i dati. Un repository di dati può consistere in uno o più file di dati strutturati, come database o file di dati non strutturati, che possono essere distribuiti su una rete e conservati a lungo termine.

Struttura di base di una banca dati

Questa sezione è dedicata alla panoramica dei principali elementi costitutivi di una banca dati.

Introduzione

Dall’invenzione dei computer, la quantità di dati immagazzinati e gestiti elettronicamente è aumentata drasticamente. Si stima che la quantità di dati raggiungerà 175 zettabyte (1021 Bytes) entro il 2025, crescendo da pochi petabyte (1015 Bytes) nell’anno 2000. Un modo comune per semplificare la vita degli utenti e sfruttare al massimo le loro risorse è quello di immagazzinarle e recuperarle in modo più efficiente. Per esempio, mentre un file piatto funziona benissimo per memorizzare i dati personali, come una rubrica o alcune ricette, non è altrettanto adatto per memorizzare un elenco telefonico di una città o, più precisamente, i dati genomici nel campo delle biotecnologie. Inoltre, se si desidera memorizzare diverse specie genomiche di dati, è molto difficile cercare e recuperare i dati da un file piatto. I database offrono una soluzione a questo problema, rendendo l’archiviazione, la gestione e il recupero dei dati molto più semplice.

Il software usato per gestire un database è chiamato sistema di gestione di un database (DBMS). Questo software specializzato funge da intermediario per aiutare gli utenti finali ad accedere al database. Di solito, gli utenti non interagiscono direttamente con un database perché questo può portare alla sua disorganizzazione. Invece, usano un DBMS che legge i dati da o scrive i dati nel database.

La crescente complessità di grandi quantità di dati ha richiesto ad alcune aziende di utilizzare strumenti di gestione dei dati basati sul modello relazionale, come il classico RDBMS. RDBMS sta per Relational Database Management System. Tuttavia, le principali società di Internet, come Google, Yahoo e Amazon, o tutti i popolari Social Media, hanno affrontato la sfida di gestire enormi quantità di dati in tempo reale, qualcosa che le soluzioni RDBMS convenzionali non potevano affrontare. Questo spiega l’impennata di popolarità dei sistemi di database NoSQL che sono sorti a fianco.

I sistemi NoSQL sono database distribuiti, non relazionali, progettati per l’immagazzinamento di dati su larga scala e per l’elaborazione di dati massicciamente parallela e ad alte prestazioni su un gran numero di server di base. Sono nati da un bisogno di agilità, performance e scala, e possono supportare un’ampia serie di casi d’uso, tra cui l’analisi esplorativa e predittiva in tempo reale. Costruiti dalle migliori compagnie internet per tenere il passo con il diluvio di dati, i database NoSQL scalano orizzontalmente e sono progettati per scalare fino a centinaia di milioni e persino miliardi di utenti che eseguono sia aggiornamenti che letture.

Alcune delle applicazioni comuni dei database NoSQL sono i social media, i fornitori di e-mail su larga scala e i sistemi sanitari governativi.

Di solito, un’applicazione sociale può passare da zero a milioni di utenti in poche settimane e per gestire al meglio questa crescita, si ha bisogno di un DB che possa gestire un numero enorme di utenti e di dati, ma che possa anche scalare facilmente in modo orizzontale.

In questo corso, ci concentreremo solo su DBMS e RDBMS. Questi sono i due tipi di database comunemente usati nel mondo delle biotecnologie fino ad oggi.

Panoramica di un’architettura di database

Figura 10: Architettura hardware per un database

I database possono memorizzare tutti i tipi di informazioni, da numeri e testo, a e-mail, contenuti web, registri telefonici, dati biologici, geografici, ecc. I database sono ufficialmente classificati secondo il modo in cui immagazzinano questi dati. I database relazionali memorizzano i dati in tabelle. I database orientati agli oggetti memorizzano i dati in classi e sottoclassi di oggetti. Ci concentreremo sui database relazionali, poiché sono i più comunemente usati. Tuttavia, la maggior parte delle topologie di base dei database hanno bisogno di avere server di backend per ospitare il sistema di gestione del database, un sistema di archiviazione collegato ai server per memorizzare la struttura e i dati del database e, naturalmente, computer, laptop, desktop o terminali come interfaccia per consentire agli utenti di accedere al database, al suo sistema di gestione e al suo contenuto. È necessaria anche una rete per lo scambio tra tutti i componenti hardware e un attacco Cloud per permettere agli utenti remoti di accedere al database. La Fig. 10 riassume in modo semplice il minimo richiesto per far funzionare un database.

Un altro modo basilare per descriverlo, è mostrare l’architettura a tre livelli di un database.

È una visione virtuale dei livelli necessari per far funzionare correttamente un database. La Fig. 11 mostra l’architettura a tre livelli. Si chiama modello ANSI-SPARC. Tuttavia, nonostante il fatto che questo modello non sia mai diventato uno standard formale, presenta l’idea di indipendenza logica dei dati che è stata ampiamente adottata.

Le informazioni memorizzate all’interno di un database relazionale sono contenute nelle tabelle. Queste tabelle sono composto di righe di dati e ogni riga contiene campi o colonne. In una definizione di database ben progettata, chiamata schema, solo dati simili vengono archiviati all’interno di ogni tabella e la duplicazione delle colonne viene mantenuta al minimo. Gli sviluppatori possono connettere o unire dati da due tabelle per collegare tra loro diversi tipi di informazioni.

Figura 11: Architettura a tre livelli

Gli indici possono essere creati sui campi nella tabella del database per rendere più facile per il DBMS recuperare i dati. Gli indici sono di solito configurati per colonne ricercate frequentemente, come il nome di una persona o un valore di data. Lo svantaggio di usare gli indici è che occupano spazio su disco e possono rallentare le cose, se ne vengono mantenuti troppi, perché ogni volta che una riga del database viene aggiornata, anche l’indice deve essere aggiornato.

La maggior parte dei database supporta lo Structured Query Language (SQL), un linguaggio standard per interagire con le informazioni contenute in un database. SQL permette agli utenti e alle applicazioni di interagire con specifici sottoinsiemi di dati da una o più tabelle usando diverse istruzioni come SELECT, INSERT, UPDATE e DELETE.

I database relazionali forniscono anche un approccio stratificato alla memorizzazione, permettendo la definizione di quali oggetti del database risiedono in specifici file di dati e dove questi file di dati sono collocati all’interno della struttura dei file del sistema operativo. Oltre a gestire la posizione fisica di memorizzazione degli oggetti del database, molti sistemi di database danno un certo controllo su come i dati sono memorizzati all’interno dei file di dati.

Termini comuni del database

Alcuni termini del database derivano da modi in cui i database automatizzano le azioni di scrittura. Gli sviluppatori di database spesso automatizzano la scrittura in determinati campi o altre tabelle, ad esempio la scrittura di una copia della riga da inserire, insieme a un timestamp o un nome utente, in una cronologia o in una tabella di controllo. La maggior parte dei sistemi DBMS offre diversi modi per gestire automaticamente le azioni di scrittura del database.

I trigger di database sono il metodo più comune per intervenire sui dati durante la scritta nel database. I trigger sono in genere associati a una particolare tabella e configurati per l’esecuzione in un determinato punto durante un’azione di scrittura specifica, ad esempio prima o dopo un aggiornamento o dopo l’inserita di una riga. I trigger possono essere utilizzati per formattare i dati, popolare una colonna con dati derivati da informazioni esistenti o persino scrivere in un’altra tabella in base alla riga da inserire o aggiornare.

Una stored procedure è un altro modo di interagire con un database relazionale. Le stored procedure sono più complesse dei trigger e non sono legate a una singola tabella specifica. In genere creati da uno sviluppatore, utilizzano una combinazione di SQL e un linguaggio di programmazione, ad esempio Java o SQL (a seconda della piattaforma di database). Le stored procedure offrono agli sviluppatori un grande controllo sul modo in cui i dati vengono convalidati o massaggiati da un’applicazione. Una stored procedure può essere utilizzata per gestire il modo in cui un utente accede a un’applicazione. La procedura potrebbe prima convalidare il nome utente e la password, quindi registrare l’esito positivo o negativo del tentativo in un’altra tabella, insieme ad altre informazioni, tra cui il nome del computer e un timestamp. Un avviso potrebbe anche essere inviato all’utente informandolo che la sua password è scaduta e deve essere modificata.

Le funzioni sono più semplici della stored procedure e talvolta possono anche essere utilizzate dall’interno delle query SQL. Le funzioni vengono in genere utilizzate in un database per eseguire un insieme di azioni che restituiscono uno o più valori, ad esempio il calcolo della somma di una colonna per le righe che corrispondono a una determinata condizione. Sebbene queste azioni possano essere eseguite utilizzando SQL, la loro creazione in una funzione può rendere ilm più facile da usare in altro codice. Sia le funzioni che le stored procedure possono eseguire azioni comuni in modo semplificato e coerente, facilitando il carico di lavoro per gli amministratori e gli sviluppatori di database.

Qual è la differenza tra i principali sistemi DBMS?

Il DBMS è generalmente guidato da ciò che le applicazioni utente devono supportare. Detto questo, ecco un breve confronto delle tre piattaforme più utilizzate.

Microsoft SQL Server è ampiamente utilizzato nelle applicazioni aziendali e si integra facilmente con altri strumenti Microsoft. Microsoft SQL Server 2019 Express è la versione più recente dell’offerta gratuita di Microsoft ed è spesso in bundle con le applicazioni che utilizzano SQL Server.

MySQL è stato uno dei preferiti dagli sviluppatori open source per la maggior parte dei due decenni. Spesso utilizzato come back-end per blog open source o sistemi di gestione dei contenuti, MySQL ha una base installata massiccia in tutto il mondo. Nel 2008, MySQL AB è stata acquisita da Sun Microsystems, che è stata a sua volta acquisita da Oracle Corp. Tuttavia, MySQL Community Edition rimane gratuito ed è ben supportato dalla community. MySQL è disponibile per numerosi sistemi operativi, tra cui Linux, UNIX, Mac OS X e Windows.

Oracle Database è considerato da molti lo standard nelle piattaforme di database a livello aziendale e supporta numerose applicazioni aziendali. Oracle Database Express Edition è disponibile gratuitamente ed è anche gratuito da distribuire (anche se non è tecnicamente software gratuito), rendendolo un’altra opzione popolare per sviluppatori o hobbisti su Windows o Linux.

Ora che hai imparato i termini e i concetti fondamentali del database, sei molto più vicino a parlare la stessa lingua degli sviluppatori di database dell’organizzazione.

Banche dati in termini scientifici

Questa parte si occupa delle basi di database utilizzate nel mondo scientifico

Introduzione alle banche dati esistenti dedicate alla scienza

Questa sezione è dedicata alla panoramica dei database di accesso aperto più comuni utilizzati nella scienza.

I continui sviluppi nei settori della biotecnologia e delle tecnologie dell’informazione hanno portato alla crescita esponenziale dei dati. Studi condotti da ricercatori dell’Istituto Europeo di Bioinformatica (EMBL-EBI) hanno dimostrato che questa crescita delle informazioni raddoppia all’incirca ogni anno. Queste ampie quantità di dati sono memorizzate, organizzate e costantemente aggiornate in banche dati scientifiche, dove sono prontamente disponibili per gli scienziati, compresi biologi e bio-informatici, da utilizzare a fini di ricerca. Le informazioni disponibili nelle banche dati biologiche sono ottenute da una serie di campi scientifici, tra cui la metabolomica, l’espressione genica dei microarray e la proteomica. Oltre a memorizzare, organizzare e condividere enormi volumi di dati, l’obiettivo principale dei database biologici è quello di offrire interfacce di programmazione delle applicazioni Web (API) per i computer per lo scambio e l’integrazione di dati da molte risorse di database diverse tramite un metodo automatizzato.

Figura 12: Esempi di nomi di basi di dati biotecnologiche

I database biologici possono essere definiti come collezioni di dati, che sono strutturati in modo tale da rendere il loro contenuto facile da esplorare, gestire e aggiornare. Esempi di tali database sono presentati in Fig. 12. Nel 1972, è stato creato il primo database sulla struttura delle proteine, conosciuto come Protein Data Bank (PDB). Questo database conteneva originariamente solo 10 voci, che ora si è espanso fino a contenere più di 10.000 voci, a significare la rapida crescita dei dati biologici. Un database biologico può contenere diversi tipi di dati, tra cui sequenze di proteine, descrizioni testuali, attributi e dati tabulari. In generale, possono essere divisi in database primari, secondari e compositi. I database primari includono dati relativi alla sola sequenza o struttura, mentre i database secondari includono dati provenienti dal database primario. I dati, come la sequenza conservata e i residui del sito attivo delle famiglie di proteine, possono essere trovati nei database di struttura secondaria. Inoltre, le voci del PDB, che è un database primario, possono essere trovate in database di struttura secondaria, memorizzati in modo organizzato.

In generale, i database biologici possono essere classificati in database di sequenza, struttura e pathway:

  • Database di sequenza: I database biologici più comunemente usati. Questi includono database di sequenze proteiche e nucleotidiche, che contengono risultati di laboratorio grezzi e sono la fonte principale per i risultati sperimentali. GenBank ed EMBL sono esempi di database di sequenza.
  • Database della struttura: Questi database contengono informazioni riguardanti la struttura proteica e le interazioni molecolari. PDB è un esempio di database di struttura.
  • Database dei pathway: Queste basi di dati si basano su dati derivati dallo studio comparativo delle vie metaboliche. La Kyoto Encyclopedia of Genes and Genomes (KEGG) e il Biocyc sono due database indicativi dei percorsi.

Una ricerca tipica in una banca dati di sequenza nucleotidica può, ad esempio, generare dati riguardanti il nome scientifico dell’organismo di origine da cui è stato isolato, il nome del contatto, la sequenza di input con i dettagli del tipo di molecola e, frequentemente, le citazioni bibliografiche relative alla sequenza.

Sono stati sviluppati alcuni strumenti per facilitare gli scienziati nell’elaborazione dei dati e nel recupero dalle banche dati biologiche. Questi strumenti, che sono definiti strumenti bioinformatici, sono programmi software creati per l’estrazione di dati significativi dal vasto numero di database biologici e per condurre analisi sequenziali o strutturali. Gli strumenti di bioinformatica vengono utilizzati per ottenere dati da database di sequenze genomiche e per la visualizzazione, l’analisi e il recupero della data da database proteomici. Questi strumenti sono in gran parte suddivisi in:

  • Strumenti di omologia e somiglianza: Questi strumenti sono utilizzati per il rilevamento di somiglianze tra le sequenze di sequenze strutturali e funzionali sconosciute, la cui funzione e struttura sono già note.
  • Strumenti di analisi della funzione proteica: Programmi applicati per il confronto di una sequenza proteica con una proteina secondaria (o derivata), che consentono la stima della funzione biochimica di una proteina interrogata.
  • Strumenti di analisi strutturale: Questi strumenti consentono il confronto delle strutture con le banche dati delle strutture note e la creazione della struttura 2D/3D di una proteina.
  • Strumenti di analisi delle sequenze: Programmi utilizzati per la valutazione aggiuntiva e più completa di una sequenza interrogata, che coinvolge l’analisi evolutiva e l’identificazione delle mutazioni.

Le banche dati biologiche possono anche essere classificate, in base all’ambito di copertura dei dati, in:

  • Banche dati complete: queste basi di dati comprendono vari tipi di dati provenienti da un certo numero di specie. Esempi di database completi sono GenBank ed EMBL.
  • Banche dati specializzate: Queste basi di dati includono particolari tipi di dati o dati provenienti da organismi particolari. Un esempio di database specializzati è WormBase, che contiene informazioni sulla biologia dei nematodi e sulla genomica.

In relazione al livello di biocurazione, che è definito come l’attività di organizzare, dimostrare e rendere le informazioni biologiche prontamente disponibili sia agli esseri umani che ai computer, i database biologici sono classificati come database primari e secondari o derivati. I database primari consistono in dati grezzi come deposito d’archivio, mentre i database secondari o derivati consistono in informazioni curate come valore aggiunto. Per quanto riguarda il metodo impiegato per curare i dati, i database biologici possono essere ulteriormente classificati come database curati da esperti o database curati dalla comunità, che sono curati in modo cooperativo da numerosi ricercatori.

Ulteriori categorizzazioni delle banche dati biologiche possono anche essere effettuate in base al tipo di dati. I tipi di dati che di conseguenza classificano i database includono DNA, RNA, proteina, espressione, percorso, malattia, nomenclatura, letteratura e standard e ontologia. Alcuni dei database biologici più importanti e ampiamente utilizzati sono i seguenti: GenBank, UCSC Genome Browser e Ensembl, che sono database/portali di sequenza; WormBase e The Arabidopsis Information Resource (TAIR), che sono database di organismi modello; e il PDB, Online Mendelian Inheritance in Man (OMIM), MetaCyc e KEGG, che sono caratterizzati come database nonincentrati sulla sequenza.

La manipolazione dei dati è una parte essenziale del processo sperimentale di tutti gli studi, indipendentemente dalla loro scala. La disponibilità online di dati biologici combinata con la diminuzione dei costi dei sequenziatori automatici del genoma ha permesso ai piccoli laboratori di biologia di diventare generatori di big data. Anche se un laboratorio non è dotato di tali strumenti, può comunque diventare un utente di big data ottenendo l’accesso a repository pubblici contenenti dati biologici, come il National Center for Biotechnology Information degli Stati Uniti a Bethesda. Gran parte della costruzione in biologia dei big data è virtuale, basata sul cloud computing, in cui dati e software si trovano in enormi centri fuori sede a cui è possibile accedere su richiesta. Pertanto, non è necessario che gli utenti acquistino il proprio hardware. Il sistema di cloud computing consente ai potenziali utenti di creare spazi virtuali per dati, software e risultati liberamente accessibili da tutti, o di mantenere gli spazi bloccati dietro un firewall consentendo l’accesso a un gruppo scelto di collaboratori.

L’uso di banche dati biologiche può essere vantaggioso in diversi settori di ricerca. Ad esempio, le basi di dati possono aiutare la progettazione sperimentale consentendo l’analisi automatica e la facile elaborazione dei dati sperimentali e rendendo semplice e rapido l’esame dei risultati sperimentali. La scoperta di farmaci è un’altra area che può essere semplificata utilizzando i database.  In questo settore specifico, le banche dati possono essere scansionate al fine di trovare nuovi candidati per i farmaci formando un classificatore su un set di dati in cui sono stati identificati farmaci funzionanti e non funzionanti. Inoltre, le tecniche di machine learning possono essere applicate a test virtuali di progettazione in grado di identificare nuovi farmaci promettenti, che possono essere successivamente analizzati in laboratorio. (RIF. 4) E, soprattutto, è possibile effettuare nuovi esperimenti scientifici e generare nuovi risultati analizzando i set di dati esistenti.

Senza l’esistenza di basi di dati, la condivisione e l’integrazione di grandi quantità di dati sarebbe praticamente impossibile. Sebbene molti scienziati della vita abbiano competenze computazionali avanzate, una grande percentuale non ha familiarità con lo sviluppo o l’adattamento del software pertinente. Tuttavia, il coinvolgimento degli scienziati della vita in questo processo è fondamentale, poiché possono fornire feedback agli specialisti di informatica concentrandosi su diverse esigenze e approcci alla scienza. La possibilità di avere accesso ai set di dati effettivi originariamente utilizzati in uno studio specifico offre ai ricercatori l’opportunità di riprodurre ed espandere tale studio. Ecco perché è importante che i dati diventino liberamente disponibili per gli scienziati in qualsiasi momento senza restrizioni, un concetto supportato da Open Science e numerose iniziative correlate. Una di queste iniziative è nota come ELIXIR, un progetto progettato per aiutare gli scienziati di tutta Europa a salvaguardare e condividere i loro dati e a rafforzare le risorse attuali, comprese le banche dati e le strutture informatiche, nei singoli paesi.

Sebbene la creazione di banche dati biologiche abbia portato molti benefici, come la promozione di una produzione scientifica di qualità abilitata dalla creazione di reti, esse richiedono comunque miglioramenti in termini di ottimizzazione delle conoscenze. È fondamentale gestire le conoscenze transdisciplinari in modo tale da portare ad un aumento della sua qualità e quantità. L’eterogeneità dei dati è un altro problema comune affrontato nell’integrazione dei dati biologici. Nel campo della biologia, esistono diversi metodi per la rappresentazione di dati simili. Ciò complica l’integrazione e l’elaborazione dei dati, il che, a sua volta, rende più difficile acquisire visualizzazioni unificate di tali dati. Un esempio di questo problema è l’uso di vari nomi alternativi quando si fa riferimento ai geni, indipendentemente dall’esistenza di linee guida complete emanate nel 1979 che propongono l’adozione di standard di nomenclatura genica, portando a difficoltà nella condivisione dei dati. L’attuazione di standard consente il riutilizzo dei dati, tuttavia, la loro assenza causa una significativa perdita di produttività e contribuisce a una diminuzione dei dati accessibili dai ricercatori. Pertanto, è imperativo trovare una soluzione a questo problema al fine di eliminare le sfide affrontate dagli scienziati quando utilizzano banche dati biologiche per condurre le loro ricerche.

Pensiero finale

Trattare i dati implica una drastica disciplina per mantenere l’accesso a lungo termine alle informazioni memorizzate. La tecnologia si evolve, il che significa che l’hardware e il software utilizzati oggi non sono lo standard di domani. Ciò significa che per poter leggere tutti i dati scritti oggi dovremo eseguire due diversi tipi di migrazioni. Una migrazione logica e una migrazione tecnologica. La migrazione logica è correlata al tipo di formato in cui vengono archiviati i dati. La migrazione tecnologica è legata al tipo di hardware utilizzato. Ad esempio, se si tenta di aprire un file di Word scritto nel 1993 con Word versione 6 con la versione più recente di Word 2019, non funzionerà. In questo esempio viene illustrata una mancanza di compatibilità logica. Per evitare questo problema e mantenere una compatibilità crescente, il file avrebbe dovuto essere migrato per l’ora alla versione più recente per mantenerlo aggiornato e leggibile con le ultime versioni del software.

Lo stesso vale per l’hardware, cioè server, archiviazione, reti, ecc… Un altro esempio potrebbe essere il tipo di server e sistema operativo utilizzato per eseguire un database. Nel caso in cui si decida di modificare l’hardware e di eseguire la migrazione da, ad esempio,Windows  a UNIX, sarà necessario un diverso tipo di hardware per eseguire  UNIX e una versione diversa del database da eseguire su  UNIX. Windows viene eseguito su piattaforme basate su Intel (e intel like) e Unix viene eseguito su piattaforme basate su SPARC, il che significa che sarà necessario eseguire la migrazione a una versione compatibile UNIX – SPARC del database.

Tenere presente questa costante evoluzione di hardware, sistemi operativi, software e formati, eseguire le migrazioni logiche e tecnologiche appropriate in tempo potrebbe farti risparmiare molto tempo e problemi.

Ultimo ma non meno importante, è importante continuare a eseguire il backup dei dati. Una volta ogni tre o sei mesi, eseguire un test di ripristino per verificare se si è in grado di recuperare i backup. Ciò è fondamentale per due motivi:

  • Ti terrà aggiornato su come ripristinare i tuoi dati

È il miglior metodo di test per vedere se i tuoi dati sono stati correttamente sottoposti a backup

Test: LO5 Livello di base

Referenze

  • Baxevanis AD, Bateman A. 2015. The importance of biological databases in biological discovery. Curr Protoc Bioinformatics., 50(1):1.1.1-1.1.8.
  • Benson DA, Clark K, Karsch-Mizrachi I, Lipman DJ, Ostell J, Sayers EW. 2014. GenBank. Nucleic Acids Res., 42:D32–D37.
  • Brooksbank C, Bergman MT, Apweiler R, Birney E, Thornton J. 2014. The European Bioinformatics Institute’s data resources 2014. Nucleic Acids Res., 42:D18–D25.
  • Caspi R, Billington R, Ferrer L, Foerster H, Fulcher CA, Keseler IM, et al. 2016. The MetaCyc database of metabolic pathways and enzymes and the BioCyc collection of pathway/genome databases. Nucleic Acids Res., 44(D1):D471-80.
  • Figueiredo MSN, Pereira AM. 2017. Managing knowledge – the importance of databases in the scientific production. Procedia Manuf., 12:166–73.
  • Harris TW, Baran J, Bieri T, Cabunoc A, Chan J, Chen WJ. 2014. WormBase 2014: new views of curated biology. Nucleic Acids Res., 42:D789–D793.
  • Howe D, Costanzo M, Fey P, Gojobori T, Hannick L, Hide W, et al. 2008. Big data: The future of biocuration: Big data. Nature., 455(7209):47–50.
  • Kanehisa M, Furumichi M, Sato Y, Ishiguro-Watanabe M, Tanabe M. 2021. KEGG: integrating viruses and cellular organisms. Nucleic Acids Res., 49(D1): D545–51.
  • Karp PD, Billington R, Caspi R, Fulcher CA, Latendresse M, Kothari A, et al. 2019. The BioCyc collection of microbial genomes and metabolic pathways. Brief Bioinform., 20(4):1085–93.
  • Kent WJ, Sugnet CW, Furey TS, Roskin KM, Pringle TH, Zahler AM, Haussler D. 2002. The human genome browser at UCSC. Genome Res., 12(6):996-1006.
  • Lapatas V, Stefanidakis M, Jimenez RC, Via A, Schneider MV. Data integration in biological research: an overview. J Biol Res (Thessalon). 2015;22(1):9.
  • Marx V. 2013. Biology: The big challenges of big data: Biology. Nature., 498(7453):255–60.
  • Nature Structural Biology 10, 980. 2003; doi: 10.1038/nsb1203-980
  • Oliveira AL. 2019. Biotechnology, big data and artificial intelligence. Biotechnol J., 14(8):e1800613.
  • Razvi SRH, Rampogu S. 2016. Bioinformatics in the present day. MOJ proteom bioinform [Internet]., 3(1):11–2. Available from: http://dx.doi.org/10.15406/mojpb.2016.03.00073
  • Toomula N, Kumar A, Kumar D S, Bheemidi VS. 2012. Biological databases- integration of life science data. J Comput Sci Syst Biol., 04(05):087-092. Available from: http://dx.doi.org/10.4172/jcsb.1000081
  • Yates AD, Achuthan P, Akanni W, Allen J, Allen J, Alvarez-Jarreta J, et al. 2020. Ensembl 2020. Nucleic Acids Res., 48(D1): D682–8.
  • Zou D, Ma L, Yu J, Zhang Z. 2015. Biological databases for human research. Genomics Proteomics Bioinformatics., 13(1):55–63.
  • Baxevanis AD, Bateman A. 2015. The importance of biological databases in biological discovery. Curr Protoc Bioinformatics., 50(1):1.1.1-1.1.8.
  • Benson DA, Clark K, Karsch-Mizrachi I, Lipman DJ, Ostell J, Sayers EW. 2014. GenBank. Nucleic Acids Res., 42:D32–D37.
  • Brooksbank C, Bergman MT, Apweiler R, Birney E, Thornton J. 2014. The European Bioinformatics Institute’s data resources 2014. Nucleic Acids Res., 42:D18–D25.
  • Caspi R, Billington R, Ferrer L, Foerster H, Fulcher CA, Keseler IM, et al. 2016. The MetaCyc database of metabolic pathways and enzymes and the BioCyc collection of pathway/genome databases. Nucleic Acids Res., 44(D1):D471-80.
  • Figueiredo MSN, Pereira AM. 2017. Managing knowledge – the importance of databases in the scientific production. Procedia Manuf., 12:166–73.
  • Harris TW, Baran J, Bieri T, Cabunoc A, Chan J, Chen WJ. 2014. WormBase 2014: new views of curated biology. Nucleic Acids Res., 42:D789–D793.
  • Howe D, Costanzo M, Fey P, Gojobori T, Hannick L, Hide W, et al. 2008. Big data: The future of biocuration: Big data. Nature., 455(7209):47–50.
  • Kanehisa M, Furumichi M, Sato Y, Ishiguro-Watanabe M, Tanabe M. 2021. KEGG: integrating viruses and cellular organisms. Nucleic Acids Res., 49(D1): D545–51.
  • Karp PD, Billington R, Caspi R, Fulcher CA, Latendresse M, Kothari A, et al. 2019. The BioCyc collection of microbial genomes and metabolic pathways. Brief Bioinform., 20(4):1085–93.
  • Kent WJ, Sugnet CW, Furey TS, Roskin KM, Pringle TH, Zahler AM, Haussler D. 2002. The human genome browser at UCSC. Genome Res., 12(6):996-1006.
  • Lapatas V, Stefanidakis M, Jimenez RC, Via A, Schneider MV. Data integration in biological research: an overview. J Biol Res (Thessalon). 2015;22(1):9.
  • Marx V. 2013. Biology: The big challenges of big data: Biology. Nature., 498(7453):255–60.
  • Nature Structural Biology 10, 980. 2003; doi: 10.1038/nsb1203-980
  • Oliveira AL. 2019. Biotechnology, big data and artificial intelligence. Biotechnol J., 14(8):e1800613.
  • Razvi SRH, Rampogu S. 2016. Bioinformatics in the present day. MOJ proteom bioinform [Internet]., 3(1):11–2. Available from: http://dx.doi.org/10.15406/mojpb.2016.03.00073
  • Toomula N, Kumar A, Kumar D S, Bheemidi VS. 2012. Biological databases- integration of life science data. J Comput Sci Syst Biol., 04(05):087-092. Available from: http://dx.doi.org/10.4172/jcsb.1000081
  • Yates AD, Achuthan P, Akanni W, Allen J, Allen J, Alvarez-Jarreta J, et al. 2020. Ensembl 2020. Nucleic Acids Res., 48(D1): D682–8.
  • Zou D, Ma L, Yu J, Zhang Z. 2015. Biological databases for human research. Genomics Proteomics Bioinformatics., 13(1):55–63.