<html xmlns:v="urn:schemas-microsoft-com:vml" xmlns:o="urn:schemas-microsoft-com:office:office" xmlns:w="urn:schemas-microsoft-com:office:word" xmlns:m="http://schemas.microsoft.com/office/2004/12/omml" xmlns="http://www.w3.org/TR/REC-html40">
<head>
<meta http-equiv="Content-Type" content="text/html; charset=utf-8">
<meta name="Generator" content="Microsoft Word 15 (filtered medium)">
<style><!--
/* Font Definitions */
@font-face
        {font-family:"MS Gothic";
        panose-1:2 11 6 9 7 2 5 8 2 4;}
@font-face
        {font-family:"Cambria Math";
        panose-1:2 4 5 3 5 4 6 3 2 4;}
@font-face
        {font-family:Calibri;
        panose-1:2 15 5 2 2 2 4 3 2 4;}
@font-face
        {font-family:Verdana;
        panose-1:2 11 6 4 3 5 4 4 2 4;}
@font-face
        {font-family:"\@MS Gothic";
        panose-1:2 11 6 9 7 2 5 8 2 4;}
/* Style Definitions */
p.MsoNormal, li.MsoNormal, div.MsoNormal
        {margin:0cm;
        margin-bottom:.0001pt;
        font-size:11.0pt;
        font-family:"Calibri",sans-serif;}
a:link, span.MsoHyperlink
        {mso-style-priority:99;
        color:blue;
        text-decoration:underline;}
a:visited, span.MsoHyperlinkFollowed
        {mso-style-priority:99;
        color:purple;
        text-decoration:underline;}
p.msonormal0, li.msonormal0, div.msonormal0
        {mso-style-name:msonormal;
        mso-margin-top-alt:auto;
        margin-right:0cm;
        mso-margin-bottom-alt:auto;
        margin-left:0cm;
        font-size:11.0pt;
        font-family:"Calibri",sans-serif;}
span.EmailStyle18
        {mso-style-type:personal-reply;
        font-family:"Verdana",sans-serif;
        color:#1F497D;
        font-weight:normal;
        font-style:normal;
        text-decoration:none none;}
.MsoChpDefault
        {mso-style-type:export-only;
        font-family:"Calibri",sans-serif;
        mso-fareast-language:EN-US;}
@page WordSection1
        {size:612.0pt 792.0pt;
        margin:72.0pt 72.0pt 72.0pt 72.0pt;}
div.WordSection1
        {page:WordSection1;}
--></style><!--[if gte mso 9]><xml>
<o:shapedefaults v:ext="edit" spidmax="1026" />
</xml><![endif]--><!--[if gte mso 9]><xml>
<o:shapelayout v:ext="edit">
<o:idmap v:ext="edit" data="1" />
</o:shapelayout></xml><![endif]-->
</head>
<body lang="EN-GB" link="blue" vlink="purple">
<div class="WordSection1">
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US">Did you get any odd messages when you ran the frequency-list setup on CQPweb?<o:p></o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US"><o:p>&nbsp;</o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US">If not – what version of the code do you have?<o:p></o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US"><o:p>&nbsp;</o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US">best<o:p></o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US"><o:p>&nbsp;</o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US">Andrew.<o:p></o:p></span></p>
<p class="MsoNormal"><span style="font-size:10.0pt;font-family:&quot;Verdana&quot;,sans-serif;color:#1F497D;mso-fareast-language:EN-US"><o:p>&nbsp;</o:p></span></p>
<p class="MsoNormal"><b><span lang="EN-US">From:</span></b><span lang="EN-US"> cwb-bounces@sslmit.unibo.it [mailto:cwb-bounces@sslmit.unibo.it]
<b>On Behalf Of </b>Hermann Lai<br>
<b>Sent:</b> 19 June 2018 11:32<br>
<b>To:</b> Open source development of the Corpus WorkBench &lt;cwb@sslmit.unibo.it&gt;<br>
<b>Subject:</b> Re: [CWB] Incorrect total words count in a Traditional Chinese corpus on CQPweb<o:p></o:p></span></p>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
<div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">part of the output of &quot;cwb-decode -C CANTON1 -ALL | less&quot;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;s&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;text&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;text_id T01&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">中環</span><span style="font-size:10.5pt">&nbsp; &nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">中環</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">保育</span><span style="font-size:10.5pt">&nbsp; &nbsp; V&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">保育</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">奇觀</span><span style="font-size:10.5pt">&nbsp; &nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">奇觀</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">:</span><span style="font-size:10.5pt">&nbsp; &nbsp; &nbsp; PU&nbsp; &nbsp; &nbsp;
</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">:</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">孫中山</span><span style="font-size:10.5pt">&nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">孫中山</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">史蹟</span><span style="font-size:10.5pt">&nbsp; &nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">史蹟</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">徑</span><span style="font-size:10.5pt">&nbsp; &nbsp; &nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">徑</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">至</span><span style="font-size:10.5pt">&nbsp; &nbsp; &nbsp; CONJ&nbsp; &nbsp;
</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">至</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">大館</span><span style="font-size:10.5pt">&nbsp; &nbsp; N&nbsp; &nbsp; &nbsp; &nbsp;</span><span style="font-size:10.5pt;font-family:&quot;MS Gothic&quot;">大館</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;/text_id&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;/text&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">&lt;/s&gt;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt"><o:p>&nbsp;</o:p></span></p>
</div>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal"><span style="font-size:10.5pt">part of the&nbsp;output of &quot;cwb-described-corpus -s CANTON1&quot;</span><o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">============================================================<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">Corpus: CANTON1<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">============================================================<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">description:&nbsp; &nbsp;&nbsp;<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">registry file:&nbsp; /usr/local/share/cwb/registry/canton1<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">home directory: /usr/local/corpora/data/canton1/<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">info file:&nbsp; &nbsp; &nbsp; /usr/local/corpora/data/canton1/.info<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">size (tokens):&nbsp; 23<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">&nbsp; 3 positional attributes<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">&nbsp; 3 structural attributes<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">&nbsp; 0 alignment&nbsp; attributes<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">p-ATT word&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;23 tokens,&nbsp; &nbsp; &nbsp; &nbsp;22 types<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">p-ATT pos&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; 23 tokens,&nbsp; &nbsp; &nbsp; &nbsp; 8 types<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">p-ATT lemma&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; 23 tokens,&nbsp; &nbsp; &nbsp; &nbsp;22 types<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">s-ATT s&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;2 regions<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">s-ATT text&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; 2 regions<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">s-ATT text_id&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;2 regions (with annotations)<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">It seems that CWB can recognize the number of words but CQPweb doesn't.<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<div>
<p class="MsoNormal">Regards,<o:p></o:p></p>
</div>
<div>
<p class="MsoNormal">Lai<o:p></o:p></p>
</div>
</div>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
<div>
<p class="MsoNormal">2018-06-19 15:43 GMT&#43;08:00 Stefan Evert &lt;<a href="mailto:stefanML@collocations.de" target="_blank">stefanML@collocations.de</a>&gt;:<o:p></o:p></p>
<blockquote style="border:none;border-left:solid #CCCCCC 1.0pt;padding:0cm 0cm 0cm 6.0pt;margin-left:4.8pt;margin-right:0cm">
<p class="MsoNormal">What does the corpus look like if you decode it from the CWB index with the following command?<br>
<br>
&nbsp; &nbsp; &nbsp; &nbsp; cwb-decode -C CANTON1 -ALL | less<br>
<br>
Can you show us part of the output?&nbsp; It would also be useful to see the output of<br>
<br>
&nbsp; &nbsp; &nbsp; &nbsp; cwb-described-corpus -s CANTON1<br>
<br>
<br>
One possibility I can think of is that your linebreaks are messed up so that CWB treats everything within the text region as a single long line.
<br>
<br>
Best,<br>
Stefan<br>
<br>
<br>
&gt; On 19 Jun 2018, at 09:26, Hermann Lai &lt;<a href="mailto:halflifelai@gmail.com">halflifelai@gmail.com</a>&gt; wrote:<br>
&gt; <br>
&gt; I am using CQPwebinabox and I have indexed a Traditonal Chinese corpus called &quot;canton1&quot; by using two commands:<br>
&gt; <br>
&gt; sudo cwb-encode -d /usr/local/corpora/data/canton1 -f /home/user/Desktop/corpora/canton1/canton1.vrt -R /usr/local/share/cwb/registry/canton1 -c utf8 -xsB -P pos -P lemma -S s:0 -S text:0&#43;id<br>
&gt; <br>
&gt; sudo cwb-make -V CANTON1<br>
&gt; <br>
&gt; After that, I install the corpus onto CQPweb. Most of the thing are correct. However, the total number of corpus texts is as same as the total words in all corpus texts.<br>
<br>
_______________________________________________<br>
CWB mailing list<br>
<a href="mailto:CWB@sslmit.unibo.it">CWB@sslmit.unibo.it</a><br>
<a href="http://liste.sslmit.unibo.it/mailman/listinfo/cwb" target="_blank">http://liste.sslmit.unibo.it/mailman/listinfo/cwb</a><o:p></o:p></p>
</blockquote>
</div>
<p class="MsoNormal"><br>
<br clear="all">
<o:p></o:p></p>
<div>
<p class="MsoNormal"><o:p>&nbsp;</o:p></p>
</div>
<p class="MsoNormal">-- <o:p></o:p></p>
<div>
<div>
<div>
<blockquote style="border:none;border-left:solid #CCCCCC 1.0pt;padding:0cm 0cm 0cm 6.0pt;margin-left:4.8pt;margin-right:0cm">
<p class="MsoNormal"><i><span style="font-size:13.5pt;font-family:&quot;Times New Roman&quot;,serif">Gaspard Germannson</span></i><o:p></o:p></p>
</blockquote>
</div>
</div>
</div>
</div>
</div>
</body>
</html>