Rasta duomenų išteklių: 4
Publikuota: 2026-04-03 Atnaujinta: 2026-08-11 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Žmogaus fenotipo ontologija lietuvių kalba, kurioje susisteminti žmogaus fenotipų pokyčių įvairovę apibūdinantys terminai ir sąvokos. Išteklius sukurtas remiantis tarptautinėmis rekomendacijomis bei standartais (https://hpo.jax.org/app/). Jis tenkina dirbtinio intelekto technologijų sprendimų poreikius, kuriant genetikos sričiai skirtus sprendimus, padeda pagerinti tarpdisciplininį susikalbėjimą, praplečia tarptautinio bendravimo genetikos srityje galimybes vienodai vertinant nustatytus žmogaus fenotipo pokyčius bei identifikuojant galimas jų priežastis, vertinant prognozę, pagerina žmogaus fenotipų ontologijos integravimą į kasdieninę medicininę praktiką, gerinant sveikatos priežiūros sistemos teikiamų paslaugų kokybę, išvengiant sisteminių klaidų. Ontologiją sudaro daugiau kaip 13 000 sąvokų rinkinių, kurių imtyje yra aiškiai ir tiksliai susisteminta ne mažiau kaip 10 000 fenotipo pokyčių, svarbių medicininiu požiūriu diferencinei diagnostikai, transliaciniams tyrimams, predikcinių, prognostinių ar pan. bioinformacinių įrankių ir modelių, kurie vertina fenotipą, kūrimui. Įgyvendinant šio ištekliaus kūrimą Projektu prie 2021–2030 metų Lietuvos Respublikos Ekonomikos ir inovacijų ministerijos valstybės skaitmeninimo plėtros programos pažangos priemonės Nr. 05-002-01-07-08 „Kurti technologinius sprendimus ir įrankius, leidžiančius saugiai ir patogiai naudotis paslaugomis“ veiklos „Kalbinių išteklių dirbtinio intelekto technologijų sprendimų poreikiams plėtra“ įgyvendinimo. Ontologijos kūrimas finansuotas NextGenerationEU ir Naujos kartos Lietuva lėšomis.

55
0
8
Publikuota: 2026-03-31 Atnaujinta: 2026-08-11 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Lietuvių vienakalbis, anglų vienakalbis ir anglų–lietuvių lygiagretusis gynybos ir saugumo tekstynai apima originalius lietuvių ir anglų kalbų tekstus, o lygiagrečiųjų tekstynų atveju – ir jų vertimus į lietuvių kalbą, suderintus sakinio lygiu. Tekstai surinkti iš Europos Sąjungos ir Lietuvos institucijų dokumentų, strategijų, teisės aktų bei kitų su gynyba ir saugumu susijusių šaltinių. Bendras tekstynų dydis: Lietuvių vienakalbis – 17 mln. žodžių. Anglų vienakalbis – 19,3 mln. žodžių. Anglų–lietuvių lygiagretusis – 119 tūkst. sakinių porų. Duomenų rinkinio struktūra: 1. Defence-Security Data Metadata.xlsx – metaduomenų dokumentas. 2. Defence-Security Data Statistics.xlsx – informacija apie duomenis, įskaitant atliktus techninių parametrų matavimus, tokius kaip gramatinių klaidų ir užsienio kalbų intarpų kiekiai bei kita statistinė informacija. 3. Katalogas „Monolingual“ – pateikiami lietuvių ir anglų kalbų vienakalbiai tekstynai TXT formatu, kiekvieno šaltinio duomenis pateikiant atskirame faile. 4. Katalogas „Parallel“ – pateikiami lygiagretieji tekstynai TMX formatu, kiekvieno šaltinio duomenis išskiriant atskirame faile. 5. Katalogas „Subdomains“ – pateikiami vienakalbiai ir lygiagretieji tekstynai, suskirstyti į 6 domenus, kiekvieno šaltinio duomenis pateikiant atskirame faile. Duomenų rinkinio failai parengti taip, kad būtų tinkami naudoti mašininio vertimo, lokalizavimo ir kituose dirbtinio intelekto taikymuose.

48
0
25
Publikuota: 2026-03-31 Atnaujinta: 2026-08-11 Valstybės skaitmeninių sprendimų agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Lietuvių vienakalbis, anglų vienakalbis ir anglų–lietuvių lygiagretusis medicinos tekstynai apima originalius lietuvių ir anglų kalbų tekstus, o lygiagrečiojo tekstyno atveju – ir jų vertimus į lietuvių kalbą, suderintus sakinio lygiu. Tekstai surinkti iš Europos Sąjungos ir Lietuvos institucijų dokumentų, mokslinių publikacijų, teisės aktų bei kitų su medicina ir sveikatos apsauga susijusių šaltinių. Bendras tekstynų dydis: Lietuvių vienakalbis – 13 mln. žodžių. Anglų vienakalbis – 12,1 mln. žodžių. Anglų–lietuvių lygiagretusis – 230 tūkstančių sakinių porų. Tekstynai apima pagrindines medicinos sritis, įskaitant bazines medicinos paslaugas, farmakologiją ir farmacijos mokslus, klinikinę mediciną, psichiatriją ir psichologiją bei visuomenės sveikatą, epidemiologiją ir ligų prevenciją, užtikrinant teminį reprezentatyvumą. Duomenų rinkinio struktūra: 1. Medical Data Metadata.xlsx – metaduomenų dokumentas. 2. Medical Data Statistics.xlsx– statistinė informacija apie duomenis, įskaitant kokybės rodiklius (pvz., gramatinių klaidų, užsienio kalbų intarpų kiekį ir kt.). 3. Katalogas „Monolingual“ – lietuvių ir anglų kalbų vienakalbiai tekstynai TXT formatu. 4. Katalogas „Parallel“ – lygiagretusis tekstynas TMX formatu. 5. Katalogas „Subdomains“ – tekstynai suskirstyti pagal medicinos sritis (domenus). Duomenų rinkinio failai parengti taip, kad būtų tinkami naudoti mašininio vertimo, lokalizavimo ir kituose dirbtinio intelekto taikymuose.

54
0
24