<?xml version="1.0" encoding="UTF-8"?>
<record
    xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
    xsi:schemaLocation="http://www.loc.gov/MARC21/slim http://www.loc.gov/standards/marcxml/schema/MARC21slim.xsd"
    xmlns="http://www.loc.gov/MARC21/slim">

  <leader>03224ntm a2200313 i 4500</leader>
  <controlfield tag="003">MY-KuUP</controlfield>
  <controlfield tag="005">20251216111123.0</controlfield>
  <controlfield tag="006">t||||fr|||| 000 0 </controlfield>
  <controlfield tag="007">ta</controlfield>
  <controlfield tag="008">251216t20252025my a|||fr|||| 000 0 eng d</controlfield>
  <datafield tag="020" ind1=" " ind2=" ">
    <subfield code="a">THE0010157 (Local)</subfield>
    <subfield code="q">Hardback</subfield>
  </datafield>
  <datafield tag="040" ind1=" " ind2=" ">
    <subfield code="a">UMPSA</subfield>
    <subfield code="b">eng</subfield>
    <subfield code="c">UMPSA</subfield>
    <subfield code="e">rda</subfield>
  </datafield>
  <datafield tag="090" ind1=" " ind2=" ">
    <subfield code="a">FKOM .H39 2025 r Thesis</subfield>
  </datafield>
  <datafield tag="100" ind1="1" ind2=" ">
    <subfield code="a">Siti Hawa Binti Apandi,</subfield>
    <subfield code="e">author.</subfield>
  </datafield>
  <datafield tag="245" ind1="1" ind2="0">
    <subfield code="a">Web page classification based on recursive Convolutional Neural Network (CNN) and word cloud image</subfield>
    <subfield code="c">Siti Hawa Binti Apandi</subfield>
  </datafield>
  <datafield tag="264" ind1=" " ind2=" ">
    <subfield code="a">Kuantan, Pahang :</subfield>
    <subfield code="b">UMPSA,</subfield>
    <subfield code="c">2025</subfield>
  </datafield>
  <datafield tag="264" ind1=" " ind2=" ">
    <subfield code="c">&#xA9; 2025</subfield>
  </datafield>
  <datafield tag="300" ind1=" " ind2=" ">
    <subfield code="a">xi, 131 pages :</subfield>
    <subfield code="b">illustrations ;</subfield>
    <subfield code="c">30 cm. +</subfield>
    <subfield code="e">CD-ROM</subfield>
  </datafield>
  <datafield tag="336" ind1=" " ind2=" ">
    <subfield code="2">rdacontent</subfield>
    <subfield code="a">text</subfield>
  </datafield>
  <datafield tag="337" ind1=" " ind2=" ">
    <subfield code="2">rdamedia</subfield>
    <subfield code="a">unmediated</subfield>
  </datafield>
  <datafield tag="338" ind1=" " ind2=" ">
    <subfield code="2">rdacarrier</subfield>
    <subfield code="a">volume</subfield>
  </datafield>
  <datafield tag="347" ind1=" " ind2=" ">
    <subfield code="2">rda</subfield>
    <subfield code="a">text file</subfield>
    <subfield code="b">PDF</subfield>
  </datafield>
  <datafield tag="500" ind1=" " ind2=" ">
    <subfield code="a">Faculty of Computing</subfield>
  </datafield>
  <datafield tag="502" ind1=" " ind2=" ">
    <subfield code="a">Thesis (Doctor of Philosophy) -- Universiti Malaysia Pahang &#x2013; 2025</subfield>
  </datafield>
  <datafield tag="504" ind1=" " ind2=" ">
    <subfield code="a">The increasing quantity and diversity of web content pose tremendous challenges to web page categorization, particularly in handling unstructured data and adapting to the dynamic nature of web content. Traditional classification methods relying on Convolutional Neural Networks (CNN) are confronted with hierarchical feature learning and long-range dependencies in text data. To overcome these constraints, this research proposes a novel web page classification model by integrating Recursive CNN with word cloud images as an alternative feature representation approach. The study aims to improve the accuracy of classification, interpretability, and computational expense by applying CNN's image processing capability to text data. The research process entails three phases: (1) Identification of effective text representation methods, (2) Developing a CNN-based classification model, and (3) Performance evaluation of the model against existing classification techniques. Web page text is extracted from HTML source codes, vectorized using the bag-of-words method, and depicted as word cloud images with high-frequency words presented in bold. The Recursive CNN model is trained using a training dataset of 391-word cloud images (274 Gaming and 117 Online Video Streaming) and tuned through grid search hyperparameter tuning. The maximum validation accuracy of the model is 89.50% for Adam optimizer, learning rate of 0.001, batch size 32, and 20 epochs, with a training time of 1 minute and 34 seconds. The overall accuracy is 89.50%, confirming the effectiveness of Recursive CNN in detecting deeper word relationships and reducing misclassification errors. Comparative analysis with existing CNN-based models demonstrates the improved adaptability and efficiency of the proposed method, confirming that word cloud images can be a good input representation for deep learning-based classification tasks. The findings provide a new benchmark for classifying web pages, reaffirming the feasibility of recursive feature extraction approaches as an instrument for future document classification, sentiment, and automated content filtering applications.</subfield>
  </datafield>
  <datafield tag="610" ind1="2" ind2="0">
    <subfield code="a">Faculty of Computing</subfield>
    <subfield code="x">Dissertations</subfield>
  </datafield>
  <datafield tag="650" ind1=" " ind2="0">
    <subfield code="a">Universities and colleges</subfield>
    <subfield code="x">Dissertations</subfield>
  </datafield>
  <datafield tag="942" ind1=" " ind2=" ">
    <subfield code="2">lcc</subfield>
    <subfield code="c">THESIS</subfield>
  </datafield>
  <datafield tag="952" ind1=" " ind2=" ">
    <subfield code="0">0</subfield>
    <subfield code="1">0</subfield>
    <subfield code="2">lcc</subfield>
    <subfield code="4">0</subfield>
    <subfield code="7">1</subfield>
    <subfield code="a">20000</subfield>
    <subfield code="b">20000</subfield>
    <subfield code="d">2025-12-16</subfield>
    <subfield code="l">0</subfield>
    <subfield code="o">FKOM .H39 2025 r Thesis</subfield>
    <subfield code="p">T000003847</subfield>
    <subfield code="r">2025-12-16 11:11:50</subfield>
    <subfield code="t">1</subfield>
    <subfield code="w">2025-12-16</subfield>
    <subfield code="y">THESIS</subfield>
  </datafield>
  <datafield tag="952" ind1=" " ind2=" ">
    <subfield code="0">0</subfield>
    <subfield code="1">0</subfield>
    <subfield code="2">lcc</subfield>
    <subfield code="4">0</subfield>
    <subfield code="7">-2</subfield>
    <subfield code="a">20000</subfield>
    <subfield code="b">20000</subfield>
    <subfield code="d">2025-12-16</subfield>
    <subfield code="l">0</subfield>
    <subfield code="o">CD13794</subfield>
    <subfield code="p">T000003848</subfield>
    <subfield code="r">2025-12-16 11:12:48</subfield>
    <subfield code="w">2025-12-16</subfield>
    <subfield code="y">THESIS</subfield>
  </datafield>
  <datafield tag="999" ind1=" " ind2=" ">
    <subfield code="c">103739</subfield>
    <subfield code="d">103745</subfield>
  </datafield>
</record>
