I data assets di Istella costituiscono la base informativa della piattaforma AI: un’infrastruttura cognitiva che integra dati interni ed esterni per arricchire la conoscenza delle organizzazioni, nel rispetto della proprietà, del controllo e della protezione delle informazioni aziendali.
Istella raccoglie, organizza e valorizza patrimoni informativi eterogenei come dati web, contenuti multimediali, informazioni social e dataset specializzati, trasformandoli in una base strutturata per la ricerca, l’analisi e le applicazioni di intelligenza artificiale. Questi asset possono essere integrati con i dati, i documenti e le fonti proprietarie dell’organizzazione, mantenendo separati gli ambiti informativi e preservando il controllo del cliente sul proprio patrimonio conoscitivo. Il risultato è un contesto più ricco e articolato, nel quale la piattaforma può individuare connessioni, recuperare informazioni rilevanti e supportare attività di retrieval, reasoning e generazione di contenuti in scenari enterprise.
Dati qualificati, selezionati e perimetrati diventano infrastruttura cognitiva: il punto di partenza per alimentare modelli, arricchire la conoscenza e rendere la piattaforma AI più precisa, contestuale e utile.
Dati web
Istella raccoglie le informazioni online e le trasforma in conoscenza utile ad arricchire i dati della piattaforma. Le fonti vengono elaborate in modo continuo, così da garantire una base sempre aggiornata e pronta a supportare ricerca, analisi e applicazioni AI.
Istella raccoglie, analizza, arricchisce e indicizza 8 miliardi di URL, con oltre 15 miliardi di URL scoperti e 150 milioni di URL aggiornati ogni giorno. Su ogni pagina vengono estratti circa 400 segnali, mentre 2.000 feed RSS e 1.500 siti news vengono analizzati con cadenza continua, ogni 10 minuti.
Il valore di questo asset non risiede soltanto nella scala, ma nella capacità di offrire una lettura del contesto che va oltre i dati proprietari del cliente. Il web diventa così una sorgente viva di informazioni aggiornate, utile a collegare fonti diverse, recuperare elementi rilevanti e restituire risposte più precise e contestualizzate.
Multimedia
Il patrimonio multimediale di Istella amplia il perimetro della conoscenza oltre il testo e integra nella piattaforma contenuti visivi e audiovisivi che diventano parte dell’intelligenza informativa. La base attuale comprende 16 terabyte di immagini indicizzate e oltre 140 milioni di video indicizzati, con un flusso giornaliero di circa 10.000 nuove immagini e 170.000 nuovi video.
Il valore distintivo di questo asset risiede nella capacità di collegare i contenuti multimediali a documenti, segnali web e knowledge graph, ampliando la profondità dell’analisi e migliorando la qualità delle risposte prodotte dalla piattaforma. In questo modo, i multimedia diventano una componente strutturale del patrimonio dati, pensata per supportare ricerca avanzata e applicazioni AI multimodali.
Social
Anche i dati social arricchiscono il patrimonio informativo di Istella con una lettura in tempo reale delle conversazioni digitali. Il sistema indicizza oltre 2,3 miliardi di tweet e raccoglie ogni giorno circa 5 milioni di tweet, con accesso anche ai firehose di Facebook e Instagram, integrando segnali che riflettono eventi, opinioni e dinamiche emergenti.
Questa base non serve solo a osservare il presente, ma anche a individuare trend emergenti, temi ricorrenti e relazioni tra persone, brand, luoghi ed eventi. In questo modo, il dato social alimenta l’arricchimento semantico, rafforza il knowledge graph e supporta applicazioni AI che devono interpretare segnali vivi, rapidi e in costante evoluzione.
A questo patrimonio informativo dinamico si affiancano dataset pubblici che testimoniano l’esperienza scientifica e tecnologica sviluppata da Istella nel campo della ricerca, del ranking e della valutazione dei modelli AI.
Dataset pubblici e competenze
I dataset Istella22 e LETOR sono benchmark pubblici sviluppati per attività di ricerca e sperimentazione. Il loro valore, per Istella, risiede nella capacità di documentare competenze proprietarie nella costruzione di sistemi di ranking, nella rappresentazione delle relazioni query-document e nella valutazione della pertinenza dei risultati. I dataset sono soggetti a specifiche condizioni di licenza e destinati a finalità non commerciali. Per informazioni sull’accesso, sull’utilizzo e sulle modalità di citazione, è necessario contattare Istella.
Istella22
Istella22 è il dataset con cui Istella evidenzia la propria esperienza nel ranking e nella valutazione dei modelli di ricerca su larga scala. Il dataset è stato progettato per consentire un confronto rigoroso tra approcci tradizionali di learning-to-rank e modelli neurali, mettendo a disposizione in un unico ambiente sia il testo delle query e dei documenti sia feature strutturate di ranking di livello industriale.
Il corpus comprende 8,4 milioni di documenti web, 220 feature query-document, 2.198 query di test e 10.693 giudizi di rilevanza, distribuiti su una scala a 5 livelli. Questa combinazione rende Istella22 particolarmente adatto alla valutazione comparativa di sistemi di ranking, re-ranking, semantic retrieval e modelli di AI applicati alla ricerca.
La forza del dataset sta nella sua capacità di unire, nello stesso benchmark, segnali testuali e segnali strutturati, permettendo di misurare in modo coerente l’efficacia di tecniche classiche e neurali. Per questo, Istella22 rappresenta un riferimento importante e una dimostrazione concreta della maturità raggiunta nella costruzione di infrastrutture per il ranking e la comprensione del contenuto.
LETOR Dataset
Il dataset LETOR rappresenta uno dei principali benchmark pubblici sviluppati da Istella per il Learning to Rank: un dataset pensato per addestrare e valutare modelli che ordinano i risultati di ricerca in base alla pertinenza, testando precisione, efficienza e capacità di scalare su grandi volumi di query e documenti.
La versione completa include 33.018 query, 220 feature per ogni coppia query-document e 10.454.629 esempi annotati con giudizi di rilevanza da 0 a 4. Il dataset è suddiviso in training e test secondo uno schema 80%-20%, con una media di 316 esempi per query, risultando particolarmente adatto alla valutazione di algoritmi di ranking basati su feature. Oltre alla versione full, Istella mette a disposizione anche Istella-S LETOR, una versione più compatta con 3.408.630 coppie e circa 103 esempi per query, e Istella-X LETOR, una versione estesa con 26.791.447 coppie ottenute recuperando fino a 5.000 documenti per query secondo il ranking BM25F.
La famiglia LETOR documenta la capacità di Istella di lavorare su grandi volumi di query e documenti, progettare segnali per il ranking e valutare la qualità dei risultati in ambienti ad alta intensità informativa.