Rasta duomenų išteklių: 23
Publikuota: 2026-08-16 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR duomenų vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalios padėties nustatymo paklaida – ne daugiau kaip 30 cm; vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, vertikalios padėties nustatymo paklaida – ne daugiau kaip 10 cm; nominalus skenavimo impulsų tankis – ne mažesnis kaip 15 taškų/kv. m.

LIDAR duomenys suklasifikuoti į šias klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (angl. Low Vegetation); • 4 klasė – vidurinė augmenija (angl. Medium Vegetation); • 5 klasė – aukšta augmenija (angl. High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – triukšmo taškai (angl. Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points).

Duomenys klasifikuoti automatiniu būdu, dėl to gali pasitaikyti taškų priskyrimo neteisingai klasei atvejų.

2026 m. duomenų rinkimui naudoti RIEGL skeneriai, dėl to LAZ failai gali turėti papildomų dimensijų (atributų): „Amplitude“, „Reflectance“, „Deviation“. Tokių failų su papildomomis dimensijomis gali neperskaityti kai kurios programinės įrangos LAS failų skaitytuvai. Perrašyti LAZ failą be papildomų dimensijų galima naudojant programą „OSGeo4W“ (atsisiuntimo nuoroda: https://qgis.org/download/?skip_donate=true, įprastai ji įdiegiama kartu su „QGIS“ programine įranga). Atsidarius „OSGeo4W Shell“ aplinką, komandinėje eilutėje iškviečiama PDAL funkcija translate, pavyzdžiui: pdal translate "C:\įvesties_failo_vieta\failo_pavadinimas.laz" "C:\išvesties_failo_vieta\failo_pavadinimas.laz" Įrašytas išvesties failas papildomų dimensijų paprastai neturi, nes translate funkcija naudoja numatytą LAS rašytuvą, kuris jų neįrašo. Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

20
0
12
Publikuota: 2026-05-22 Atnaujinta: 2026-06-04 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Nuasmeninimo tekstyno sukūrimas (NUS)“, Nr. 02-100-K-0001.

Apimtis. 41 312 įrašų (13 762 478 žodžiai, 520 904 sakiniai), kiekvienas tekstas anotuotas asmens duomenų (angl. personally identifiable information, PII) atžvilgiu — iš viso 1 487 589 anotacijos. Mokymo imtis — 41 189 įrašai (administraciniai, moksliniai ir žiniasklaidos tekstai), testavimo (validacijos) imtis — 123 įrašai. Duomenys pateikiami JSONL, CoNLL-2003 (BIO) ir TEI P5 XML formatais.

Tekstyno sandara. Asmens duomenų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio asmens duomenų aptikimo ir nuasmeninimo (angl. de-identification) sistemų giliojo mokymo pagrindu apmokymui bei vertinimui. Tekstyną sudaro originalūs lietuvių kalba parengti tekstai kartu su rankiniu būdu pažymėtomis asmens duomenų anotacijomis. Iš viso išskirti 24 anotacijų tipai, suskirstyti į dvi grupes: 16 bendrųjų kategorijų (PER, LOC, ORG, ID_PER, ID_MISC, NUM_PHONE, NUM_CAR, MISC, OCC, EDU, AGE, DATE, TIME, DURATION, VALUE, NAT) ir 8 BDAR specialiosios kategorijos „jautrūs" duomenys (HEALTH, REL, POL, ETH, MAR, FAM, GENDER, SEX). Jautrių duomenų anotacijos sudaro apie 2,84 proc. visų anotacijų, atspindint jų faktinį pasiskirstymą realiuose tekstuose.

Tekstyną sudaro trys skirtingos teminės dalys ir stratifikuota validacijos imtis. Proporcijos pagal žodžių skaičių: 1. administraciniai tekstai — 11 487 490 žodžių (apie 83 proc. tekstyno), 2. moksliniai tekstai — 1 108 602 žodžiai (apie 8 proc.), 3. žiniasklaidos tekstai — 1 107 917 žodžių (apie 8 proc.), 4. validacijos imtis — 58 469 žodžiai (apie 0,4 proc.).

Pagal įrašų skaičių dominuoja administracinė sritis (38 468 įrašai), toliau: žiniasklaida (2 451), moksliniai tekstai (270) ir validacijos imtis (123).

Tekstų šaltiniai. Administracinės dalies tekstai surinkti iš 111 šaltinių — Lietuvos savivaldybių ir valstybės institucijų interneto svetainių (laikotarpis 2001–2025 m.); 3,8 proc. (1 480 įrašų) šios dalies sudaro sintetiniai tekstai, sugeneruoti Gemma 2 27B modeliu ir atitinkamai pažymėti (original_id prefiksas translated_synthetic_admin_texts_*). Mokslinės dalies tekstai paimti iš VDU CRIS (Lituanistikos duomenų bazės) ir atvirosios prieigos Vilniaus universiteto leidyklos žurnalų (laikotarpis 2000–2025 m.). Žiniasklaidos dalies tekstai — Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai (2019–2020 m. archyvas ir 2024–2025 m. svetainės surinkimas). Validacijos imtis — filtruotas pirmiau išvardytų šaltinių poaibis, atspindintis visų trijų dalykinių sričių pasiskirstymą.

Projekto tikslas. Parengti ne mažiau kaip 10 mln. žodžių nuasmeninimo tekstyną, kuriame būtų sužymėtos BDAR aktualios įvardintos esybės (angl. named entities), atspindinčios bendrą asmeninę informaciją apie realaus pasaulio asmenis, tokiu būdu sudarant galimybes tekstyną naudoti automatizuotam duomenų anonimizavimui/ užkodavimui pagal BDAR reikalavimus ir mašininio arba giliojo mokymo technologijų sprendimų apmokymui.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengtas automatinis asmeninės informacijos aptikimo modelis lietuvių kalbai:

  1. Nuasmeninimo modelis, paremtas XLM-RoBERTa architektūra: NUS-LT-PII-xlm-roberta-large (https://huggingface.co/VytautoDidziojoUniversitetas/NUS-LT-PII-xlm-roberta-large).

56
1
4
Publikuota: 2026-05-22 Atnaujinta: 2026-05-22 Vytauto Didžiojo universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

NextGenerationEU projektas „Santraukų tekstynai dirbtiniam intelektui“, Nr. 02-101-K-0001.

Apimtis: 2340 tekstų (1 738 609 žodžiai), kiekvienas tekstas suporuotas su dviem žmonių parengtomis santraukomis: abstraktyvia (iš viso 352 591 žodis) ir ekstraktyvia (iš viso 494 861 žodis). Mokymo imtis – 2240 tekstų, testavimo imtis – 100 tekstų. Duomenys pateikiami CSV, JSON ir XML formatais.

Tekstyno sandara. Santraukų tekstynas priskirtinas specializuotiems lietuvių kalbos tekstynams, skirtiems automatinio santraukų sudarymo (angl. automatic summarisation) sistemų giliojo mokymo pagrindu apmokymui ir vertinimui. Tekstyną sudaro originalūs lietuvių autorių parengti tekstai kartu su žmonių parašytomis abstraktyviomis ir ekstraktyviomis santraukomis. Kiekviena santrauka sudaro ne mažiau kaip 10 proc. originalaus teksto apimties.

Tekstyną sudaro keturios skirtingos dalys: informacinių technologijų (IT), teisės (teisė), medicinos (medicina) ir žiniasklaidos (žiniasklaida). Proporcijos: 1. teisės tekstai – 668 276 žodžiai (apie 38 proc. tekstyno), 2. medicinos tekstai – 371 611 žodžių (apie 21 proc.), 3. žiniasklaidos tekstai – 354 012 žodžių (apie 20 proc.), 4. informacinių technologijų tekstai – 344 710 žodžių (apie 20 proc.).

Pagal tekstų skaičių dominuoja informacinių technologijų sritis (689 tekstai), toliau: žiniasklaida (568), medicina (550) ir teisė (533).

Tekstų šaltiniai. Informacinių technologijų dalies tekstai surinkti iš IT tinklaraščių (pvz., technologijos.lt), studentų bakalauro ir magistro baigiamųjų darbų (pvz., VDU CRIS) bei Vilniaus universiteto IT mokslo žurnalų (zurnalai.vu.lt). Teisės dalies tekstai paimti iš Lietuvos teismų informacinės sistemos LITEKO, Lietuvos Respublikos teisės aktų registro, Lietuvos Aukščiausiojo Teismo jurisprudencijos, teisės publikacijų (pvz., teise.pro) ir mokslinių straipsnių (pvz., elaba.lt). Medicinos dalies tekstai – Valstybės duomenų agentūros parengti anonimizuoti vaistinių dokumentai ir gydytojų diagnozės. Žiniasklaidos dalies tekstai – Lietuvos nacionalinio transliuotojo LRT.lt portale publikuoti straipsniai.

Projekto tikslas. Parengti ir validuoti mišrius lietuvių kalbos tekstų santraukų / abstraktų tekstynus, skirtus automatinio sudarymo giliojo mokymo pagrindu veikiančių sistemų apmokymui. Projektas vykdomas Vytauto Didžiojo universiteto kartu su partneriu Vilniaus universitetu pagal planą „Naujos kartos Lietuva“ (komponentas „Skaitmeninė transformacija ekonomikos augimui“), projekto Nr. 02-101-K-0001.

Tekstyno pagrindu parengti giliojo mokymosi sprendimai. Remiantis šio tekstyno duomenimis, parengti du automatinio santraukų sudarymo modeliai lietuvių kalbai: 1. ekstraktyvaus santraukų sudarymo modelis, paremtas XLM-RoBERTa architektūra: LT-ABS-extractive-xlm-roberta (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-extractive-xlm-roberta); 2. abstraktyvaus santraukų sudarymo modelis, paremtas Gemma 3 12B architektūra: LT-ABS-abstractive-Gemma3-12b (https://huggingface.co/VytautoDidziojoUniversitetas/LT-ABS-abstractive-Gemma3-12b).

47
1
0
Publikuota: 2026-05-13 Atnaujinta: 2026-05-13 Vilniaus universitetas
Duomenų išteklius viešinamas: Taip Brandos lygis:

Lietuvių kalbos garsynas LIEPA-3 yra skirtas šnekos atpažinimo (ASR, STT) taikymams ir moksliniams tyrimams. Bendra anotuota garsyno trukmė yra 10000 val. Garsyną sudaro garso įrašai FLAC formatu (44.1 kHz, 16 bitų, mono) ir juos atitinkantys anotacijų failai teksto formatu žodžio bei frazių lygmens anotacijose bei Praat TextGrid (https://praat.org/) formatu foneminėse anotacijose. Garsyne įrašyta skaitoma šneka, spontaninė šneka ir lietuviškos tarmės. Garsynas sąlyginai sudalintas į kelis subgarsynus: spontaninės šnekos (SPON - 4900 val.), skaitomos šnekos (READ - 5000 val.), tarmių (DIAL - 100 val.) bei fonemiškai anotuotą garsyną (PHON - 500 val.). Bendras garsyno dydis yra 1,3 TB (ZIP formatas, dalys atsisiuntimui po 10 GB). Garsynas anotuotas fonemų lygmenyje (500 valandų), žodžių (10 000 valandų) ir frazių (10 000 valandų) lygmenyse.

178
0
10
Publikuota: 2026-05-10 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

75
0
4
Publikuota: 2026-05-10 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

26
0
3
Publikuota: 2026-05-10 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

49
0
1
Publikuota: 2026-05-10 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR tankis yra ne mažiau 6.5 tšk./m2. Vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalaus nustatymo paklaida RMSE – ne daugiau kaip 30 cm, vertikalaus – ne daugiau kaip 10 cm. LIDAR duomenys išlyginti ir suklasifikuoti pagal LAS specifikaciją į 8 klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (Low Vegetation); • 4 klasė – vidutinė augmenija (Medium Vegetation); • 5 klasė – aukšta augmenija (High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – Triukšmo taškai Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

23
0
2
Publikuota: 2026-05-10 Atnaujinta: 2026-08-16 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIDAR duomenų vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, horizontalios padėties nustatymo paklaida – ne daugiau kaip 30 cm; vidutinė kvadratinė taško, esančio ant tvirtų, nekintančių objektų, vertikalios padėties nustatymo paklaida – ne daugiau kaip 10 cm; nominalus skenavimo impulsų tankis – ne mažesnis kaip 15 taškų/kv. m.

LIDAR duomenys suklasifikuoti į šias klases: • 0 ir (ar) 1 klasė – neklasifikuoti taškai (angl. Created, never classified; Unclassified); • 2 klasė – žemės paviršiaus taškai (angl. Ground); • 3 klasė – žema augmenija (angl. Low Vegetation); • 4 klasė – vidurinė augmenija (angl. Medium Vegetation); • 5 klasė – aukšta augmenija (angl. High Vegetation); • 6 klasė – pastatų, statinių taškai (angl. Building); • 7 klasė – triukšmo taškai (angl. Low Point (noise); • 12 klasė – persidengimo taškai (angl. Overlap Points). LIDAR duomenų surinkimo laikotarpis – gegužės-spalio mėn.

Duomenys klasifikuoti automatiniu būdu, dėl to gali pasitaikyti taškų priskyrimo neteisingai klasei atvejų.

Skirtingai nuo ankstesnių metų, 2025 m. duomenų rinkimui naudoti RIEGL skeneriai, dėl to LAZ failai gali turėti papildomų dimensijų (atributų): „Amplitude“, „Reflectance“, „Deviation“. Tokių failų su papildomomis dimensijomis gali neperskaityti kai kurios programinės įrangos LAS failų skaitytuvai. Perrašyti LAZ failą be papildomų dimensijų galima naudojant programą „OSGeo4W“ (atsisiuntimo nuoroda: https://qgis.org/download/?skip_donate=true, įprastai ji įdiegiama kartu su „QGIS“ programine įranga). Atsidarius „OSGeo4W Shell“ aplinką, komandinėje eilutėje iškviečiama PDAL funkcija translate, pavyzdžiui: pdal translate "C:\įvesties_failo_vieta\failo_pavadinimas.laz" "C:\išvesties_failo_vieta\failo_pavadinimas.laz" Įrašytas išvesties failas papildomų dimensijų paprastai neturi, nes translate funkcija naudoja numatytą LAS rašytuvą, kuris jų neįrašo. Duomenys teikiami suskaidyti lapais, pagal LKS-94 skaidymą *.laz formatu. Kiekviename iš lapų yra talpinama URL nuoroda skirta nurodytos teritorijos parsisiuntimui.

Didelės vertės rinkiniai

52
0
6
Publikuota: 2026-04-28 Atnaujinta: 2026-04-28 Vyriausioji rinkimų komisija
Duomenų išteklius viešinamas: Taip Brandos lygis:

VRKIS paskirtis - informacinių technologijų priemonėmis tvarkyti rinkimų ir referendumų organizavimo, Rinkėjų sąrašų sudarymo ir tvarkymo, politinių partijų ir politinių kampanijų finansavimo kontrolės užtikrinimo, rezultatų nustatymo, rinkėjų ir kandidatų informavimo apie rinkimus, kandidatų parėmimo duomenis

41
0
0
Duomenų išteklius viešinamas: Taip Brandos lygis:

ANRIS paskirtis – registruoti Lietuvos Respublikos administracinių nusižengimų registro įstatymo 3 straipsnio 1 dalyje nustatytus ANRIS objektus, užtikrinti administracinių nusižengimų teisenos ir Lietuvos Respublikos įstatymų bei Europos Sąjungos teisės aktų (toliau – specialieji teisės aktai) nustatyta tvarka užfiksuotų ūkio subjektų padarytų teisės pažeidimų, už kuriuos priežiūros institucijos skiria ūkio subjektams specialiuosiuose teisės aktuose nustatytas poveikio priemones, (toliau – ūkio subjekto teisės pažeidimai) tyrimą, rinkti, kaupti, apdoroti, sisteminti, saugoti ir teikti fiziniams ir juridiniams asmenims ANRIS duomenis, atlikti kitus ANRIS duomenų tvarkymo veiksmus.

194
0
1
Publikuota: 2026-03-22 Atnaujinta: 2026-03-22 Viešoji įstaiga Statybos sektoriaus vystymo agentūra
Duomenų išteklius viešinamas: Taip Brandos lygis:

Informacinių technologijų priemonėmis teikti su statybos dokumentų išdavimu ir statybos valstybine priežiūra susijusias paslaugas, vykdyti su statybos sritimi susijusių dokumentų, duomenų, informacijos apskaitą, stebėseną, kontrolę, pakartotinį naudojimą susijusiuose procesuose bei surinktus duomenis, informaciją panaudoti susijusių veiklų analizei

66
0
1
Publikuota: 2026-03-04 Atnaujinta: 2026-03-05 Lietuvos nacionalinis dailės muziejus
Duomenų išteklius viešinamas: Taip Brandos lygis:

LIMIS paskirtis – informacinių technologijų priemonėmis vykdyti Lietuvos muziejų ir kitų juridinių bei fizinių asmenų saugomų kultūros paveldo objektų kompiuterizuotą apskaitą, kaupti ir išsaugoti duomenis apie muziejuose kaupiamus ir saugomus kultūros paveldo objektus, taip pat integruoti sklaidai skirtus duomenis į nacionalinę ir tarptautinę virtualią kultūros paveldo erdvę ir teikti el. paslaugas.

23
0
0