Geração de Impressão Digital para Recuperação de Documentos Similares na Web
Resumo
Este artigo apresenta um mecanismo para geração da “impressão digital” de um documento da Web. Esse mecanismo é parte de um sistema para detectar e recuperar documentos que tenham sido plagiados da Web, sendo similares a um dado documento suspeito. O processo é composto de três etapas: a) geração de uma impressão digital do documento suspeito, b) coleta de documentos candidatos da Web e c) comparação entre cada documento candidato e o documento suspeito. Na primeira etapa, a impressão digital do documento suspeito é usada para identificá-lo. A impressão digital é constituída por um conjunto de frases mais representativas do documento. Na segunda etapa, as frases que constituem a impressão digital são usadas como consultas e submetidas para uma máquina de busca. Os documentos identificados pelas URLs da resposta da pesquisa são coletados e formam um conjunto de documentos candidatos à similaridade. Na terceira etapa, os documentos candidatos são localmente comparados com o documento suspeito. O foco deste trabalho está na geração da impressão digital do documento plagiado. Experimentos foram realizados sobre uma coleção de documentos plagiados construída especialmente para este trabalho. Para a impressão digital de melhor resultado, em média 87, 06% dos documentos usados na composição do documento plagiado foram recuperados da Web.Referências
Brin, S., Davis, J., and Garcia-Molina, H. (1995). Copy detection mechanisms for digital documents. In ACM SIGMOD Annual Conference, pages 398–409, San Francisco.
Broder, A. (1998). On the resemblance and containment of documents. In Compression and Complexity of Sequences (SEQUENCES’97), pages 21–29. IEEE Computer Society.
Garcia-Molina, H., Gravano, L., and Shivakumar, N. (1996). dscam : Finding document copies across multiple databases. In 4th International Conference on Parallel and Distributed Systems (PDIS’96), Miami Beach.
Garcia-Molina, H., Ketchpel, S. P., and Shivakumar, N. (1998). Safeguarding and charging for information on the internet. In International Conference on Data Engineering (ICDE’98).
Manber, U. (1994). Finding similar files in a large file system. In Proceedings of the USENIX Winter 1994 Technical Conference, pages 1–10, San Fransisco, CA, USA.
Morrison, D. R. (1968). Practical algorithm to retrieve information coded in alphanumeric. ACM, 15(4):514–534.
Pereira-Jr, A. R. (2004). Recuperação de documentos similares na web. Master’s thesis, Departamento de Ciência da Computação da Universidade Federal de Minas Gerais, Belo Horizonte, Brasil.
Pereira-Jr, A. R. and Ziviani, N. (2003). Syntactic similarity of web documents. In First Latin American Web Congress, pages 194–200, Santiago, Chile.
Shivakumar, N. and Garcia-Molina, H. (1995). Scam: A copy detection mechanism for digital documents. In 2nd International Conference in Theory and Practice of Digital Libraries (DL’95), Austin, Texas.
Stricherz, M. (2001). Many teachers ignore cheating, survey finds. Education Week. [link].
Broder, A. (1998). On the resemblance and containment of documents. In Compression and Complexity of Sequences (SEQUENCES’97), pages 21–29. IEEE Computer Society.
Garcia-Molina, H., Gravano, L., and Shivakumar, N. (1996). dscam : Finding document copies across multiple databases. In 4th International Conference on Parallel and Distributed Systems (PDIS’96), Miami Beach.
Garcia-Molina, H., Ketchpel, S. P., and Shivakumar, N. (1998). Safeguarding and charging for information on the internet. In International Conference on Data Engineering (ICDE’98).
Manber, U. (1994). Finding similar files in a large file system. In Proceedings of the USENIX Winter 1994 Technical Conference, pages 1–10, San Fransisco, CA, USA.
Morrison, D. R. (1968). Practical algorithm to retrieve information coded in alphanumeric. ACM, 15(4):514–534.
Pereira-Jr, A. R. (2004). Recuperação de documentos similares na web. Master’s thesis, Departamento de Ciência da Computação da Universidade Federal de Minas Gerais, Belo Horizonte, Brasil.
Pereira-Jr, A. R. and Ziviani, N. (2003). Syntactic similarity of web documents. In First Latin American Web Congress, pages 194–200, Santiago, Chile.
Shivakumar, N. and Garcia-Molina, H. (1995). Scam: A copy detection mechanism for digital documents. In 2nd International Conference in Theory and Practice of Digital Libraries (DL’95), Austin, Texas.
Stricherz, M. (2001). Many teachers ignore cheating, survey finds. Education Week. [link].
Publicado
31/07/2004
Como Citar
PEREIRA JR, Álvaro R.; ZIVIANI, Nivio.
Geração de Impressão Digital para Recuperação de Documentos Similares na Web. In: SIMPÓSIO BRASILEIRO DE TECNOLOGIA DA INFORMAÇÃO E DA LINGUAGEM HUMANA (STIL), 2. , 2004, Salvador/BA.
Anais [...].
Porto Alegre: Sociedade Brasileira de Computação,
2004
.
p. 30-39.
