mitrius | Корпусно-информационное

Пересылая файлы для Корпуса, давно заметил, что тексты с грамматической разметкой (то есть такие, где каждому слову приписан его морфологический разбор, вроде гуляющими{гулять=Г,нс,нп=прч,нст,дст,тв,мн}; причём если вариантов несколько, как у словоформы большой, то даются все, и грамматическая омонимия не снимается; кроме того, есть простой синтаксис в виде границ клауз и элементарных составляющих) в заархивированном виде имеют примерно такой же объём, что и исходные тексты без архива и без разметки.

То есть известно, что текст на естественном языке информационно избыточен и сильно ужимается при кодировании. Но вроде как выходит, что эта избыточность в русском языке (наверное, в агглютинативных вроде тюркских будет не так или по крайней мере не совсем так) компенсируется плотностью морфологического ряда, синтаксическим членением и неоднозначностью, и если расписать тут же пространство возможных анализов, то объём информации выйдет тот же.

Иными словами, текст кодируется вместе со своим "переводом" на метаязык, и код получается почти равным входу.

Можно представить себе возражение на то, что я сказал: "а если тут же рядом перевод на немецкий или кечуа записать, так тоже небось компенсирует". Почему-то кажется, что "так, да не так".

Flat | Top-Level Comments Only

From:

tigris-traum.livejournal.com

а почему омонимия не снимается? помнится, одно из заданий не-помню-к-чему заключалось как раз в грамедите с ручным (лапками, лапками) снятием омонимии. нет?

mitrius.livejournal.com

Так это я посылаю неснятые файлы к лапкам, а лапки присылают мне снятое, но уже в Ворде, так что вступает дополнительный код и уже не разберёшься.

S	M	T	W	T	F	S
					1	2
3	4	5	6	7	8	9
10	11	12	13	14	15	16
17	18	19	20	21	22	23
24	25	26	27	28	29	30
31

Mitrius' LiveJournal

Корпусно-информационное

Корпусно-информационное

no subject

no subject

Profile

January 2021

Most Popular Tags

Page Summary

Style Credit

Expand Cut Tags