Vistas de página en total

Buscar este blog

miércoles, 13 de abril de 2011

Busqueda con Protocolo Z39.50

En esencia el Z39.50 permite que un ordenador cliente sea capaz de buscar información en un ordenador servidor y recuperar el resultado de esa búsqueda, a través de especificaciones o reglas de intercambio. Al resolver el problema de la comunicación entre dos sistemas con hardware y software diferentes, se abre la posibilidad de consultar cualquier recurso local o remoto de información bibliográfica, textual o de otro tipo, sin necesidad de conocer cientos de interfaces de usuarios ni la estructura de decenas de bases de datos. La función esencial de cualquier cliente Z39.50 es permitir al usuario realizar búsquedas en bases de datos que cuenten con un servidor Z39.50. El proceso de búsqueda en una sesión Z39.50 consta de las siguientes partes:

1. El usuario del OPAC selecciona una biblioteca objeto. 2. El usuario introduce en el OPAC los términos de búsqueda. 3. La parte del software del OPAC donde trabaja el estándar envía los términos de búsqueda traducidos a lenguaje Z y contacta con el Servidor Z que contiene los recursos de información requeridos.

4. Cuando los dos ordenadores se contactan, se inicia un período de negociación entre ambos, en el que se establecen las reglas de asociación entre los dos sistemas.

5. El Servidor Z traduce el lenguaje Z recibido a una solicitud de búsqueda y responde con los resultados de la búsqueda. 6. El Cliente Z recibe los registros. 7. Finalmente, el resultado aparece en el OPAC del usuario como si se tratara de un registro del propio OPAC.

Servicios del Protocolo Z39.50

Al realizar una búsqueda con Z39.50 existen servicios mínimos que el cliente Z debe contemplar, servicios que se agrupan en lo que el estándar denomina "facilidades":

• Inicialización: configuración de las reglas de comunicación, negociación de los niveles del servicio.

• Búsqueda: envío de una cadena de búsqueda a una base de datos y recuperación de un juego de resultados, y los primeros registros.

- Búsqueda booleana compleja. - Elementos de comparación por fechas. - Operadores de proximidad. - Truncamiento. - Búsquedas completas.

• Recuperación: recuperación de registros tal y como se especificó en el Cliente Z.

• Borrar juego de resultados: permite a un cliente solicitar que se borre un conjunto de resultados determinado, o todos ellos.

• Control de acceso: proceso de verificación por parte del Servidor Z, pedir passwords, etc. • Control de cuentas: gestión de cuentas, crédito, etc.

• Ordenar: permite que el cliente solicite al servidor una ordenación del conjunto de resultados, o unir varios conjuntos y luego ordenar el resultado.

• Visualizar índices: escaneo e índice en el Servidor Z.

• Servicios extendidos: permite al Cliente Z comenzar un paquete de tareas: - Guardar juegos de resultados para uso posterior. - Guardar estrategias de búsquedas. - Definir calendarios periódicos de búsquedas. - Solicitar ejemplares. - Actualizar bases de datos. - Crear especificaciones de exportación.

• Información sobre el servidor: ofrece detalles del servidor como bases de datos disponibles, índices, servicios disponibles.... con idea de que se puedan desarrollar clientes que se auto configuren en función de los servidores que encuentren.

• Terminación: concluye la negociación y la conexión.

GUAJARDO Salinas, Aldo. Z39.50 y OAI-PMH: Protocolos de Transferencia y Recuperación de Información. 2010. p.3. Disponible en: http://www.bibliotecarios.cl/descargas/2010/11/guajardo_z3950.pdf

lunes, 11 de abril de 2011

Búsqueda y Recuperación de Información - Protocolos de Transferencia

Los Sistemas de Información Documental (SID)


Corresponden a un tipo especial de sistema de información cuyo propósito principal es generar información útil a una necesidad específica de información suministrada por un usuario, con el fin de producir nuevo conocimiento.


La información generada por el sistema de información documental se representa mediante documentos que son manejados por el sistema como objetos de información digital (por ejemplo, en los Sistemas Integrados de Gestión de Bibliotecas (SIGB) y en las actuales bibliotecas digitales).


Son numerosos los protocolos desarrollados a través de los años con el fin de permitir la interoperabilidad entre Sistemas de Información Documental (SID):

• Z39.50 • Simple Digital Library Interoperability Protocol (SDLIP) • OAI (Open Archives Protocol) • Guildford protocol • Dienst protocol • ZING SRU/W • Starts (Stanford Protocol Proposal for Internet Retrieval and Search) • Dienst protocol • Lyceum Protocol • Harvest: A Distributed Search System

Sin embargo, sólo algunos de éstos se han consolidado internacionalmente como estándares aceptados por los profesionales de la información, son usados de manera masiva y su desarrollo y mantención se encuentra avalado por iniciativas tanto públicas como privadas: el Protocolo Z39.50 y el Protocolo OAI-PMH.


Protocolo Z39.50

El Z39.50 (Information Retrieval (Z39.50); Application Service Definition and Protocol Specification. ANSI/NISO Z39.50-2003) es un protocolo para la recuperación de información basado en la estructura cliente/servidor que facilita la interconexión de sistemas informáticos y que podría considerarse como la norma más relevante para el mundo de las bibliotecas y de la documentación desde la aparición del formato MARC.


Lo que hace el protocolo Z39.50 es especificar un conjunto de reglas para gestionar las formas y procedimientos de interconexión remota de computadoras, con el propósito de buscar y recuperar información, aunque su aplicación actual es más amplia pues incluye la consulta y el intercambio de datos bibliográficos, y la intercomunicación de índices y resúmenes, de información geoespacial, de documentos oficiales, de objetos digitales o de metadatos que describen los documentos de las bibliotecas electrónicas o digitales.


La estructura del Z39.50 utiliza:

• Un cliente u origin también conocido como Cliente Z, el que se comunica con procesos auxiliares que se encargan de establecer conexión con el servidor, enviar el pedido, recibir la respuesta, manejar las fallas y realizar actividades de sincronización y seguridad. El usuario interactúa con el cliente de forma gráfica.


• Un servidor o target conocido como Servidor Z, el que proporciona un servicio al cliente y entrega los resultados de una tarea específica, estableciendo procesos auxiliares que se encargan de recibir las solicitudes del cliente, verificar la protección, activar un proceso servidor para satisfacer el pedido, recibir su respuesta y enviarla al cliente.

• Una estructura de datos. • Reglas de intercambio. • Un transporte de información confiable como son TCP/IP (Transmission Control Protocol/Internet Protocol) y OSI (Open System Interconnection).

GUAJARDO Salinas, Aldo. Z39.50 y OAI-PMH: Protocolos de Transferencia y Recuperación de Información. 2010. p.1,2. Disponible en: http://www.bibliotecarios.cl/descargas/2010/11/guajardo_z3950.pdf

búsqueda y recuperación de información - Infranet

La Infranet o Internet invisible La infranet o Internet invisible es el conjunto de recursos accesibles únicamente a través de algún tipo de pasarela o formulario web y que, por tanto, no pueden ser indizados de forma estructural por los robots de los motores de búsqueda. Muchos de estos recursos son de gran calidad y, desde el punto de vista del gestor de información, tienen una importancia clave en la recuperación de información de alto valor añadido. Su invisibilidad para los motores de búsqueda implica una dificultad considerable para la recuperación efectiva de estos recursos y requiere aproximaciones novedosas por parte de los profesionales.

1.3.1. Los recursos de la Internet invisible

La propia heterogeneidad formal de la información en Internet puede plantear dificultades a la hora de entender qué recursos están incluido bajo la denominación de Internet Invisible. Con el fin de clarificar qué contenidos pueden resultar invisibles, se ha considerado una clasificación que atiende a criterios documentales. Bases de datos bibliográficas: se incluyen en este grupo los catálogos de biblioteca accesibles a través de una pasarela (OPAC) web, otras bases de datos de referencias bibliográficas (de acceso público o restringido –registro previo gratuito o de pago-) y entidades similares tales como los catálogos de librerías (ej.: Amazon.com) Bases de datos alfanuméricas: definidas por exclusión del grupo anterior, son todas las bases de datos que no tienen carácter bibliográfico. Comprendería, además, los recursos llamados de referencia que requiren algún tipo de pasarela de acceso para su consulta (ej.: Encyclopaedia Britannica). Una situación ligeramente distinta es la planteada por las páginas generadas dinámicamente (asp, jsp, php o similares). Dichas páginas sólo existen en virtud de una consulta puntual, imposible de realizar por los robots de los motores de búsqueda y cuyo contenido puede alcanzar un considerable grado de personalización. Desde un punto de vista documental, los contenidos que explotan están en una base de datos y, por tanto, se consideran dentro de esta categoría. Archivos y revistas electrónicas: se trata de bases de datos que incluyen documentos a texto completo y que sólo se pueden recuperar previa identificación de la referencia, labor para la que se requiere utilizar una pasarela web simple (formulario de consulta) o doble (palabra de acceso y formulario de consulta). Ficheros no HTML o textuales: el (relativo) fracaso de HTML original a la hora de generar páginas con una maquetación muy rica, ha permitido que algunos formatos de diseño más elaborado hayan adquirido popularidad en la web (pdf, ps, ppt, doc). Estos formatos no textuales no son indizados correctamente por los robots de los motores de búsqueda (excepción: Google.com ya indiza documentos pdf y los convierte en HTML) y, por tanto, constituyen una parte del webespacio invisible que ha ido adquiriendo cada vez más importancia.

1.3.2. La recuperación de la información en la Internet invisible

La recuperación de la información en la Internet invisible se apoya fundamentalmente en la disponibilidad de directorios e índices que identifiquen y organicen su principales recursos. El más importante en el mercado español es la sede española de Internet Invisible http://www.internetinvisible.com Las herramientas más importantes para la recuperación de estos recursos de información invisibles son:

Clientes Z39.50: La progresiva adopción del protocolo Z39.50 por la mayoría de las bibliotecas está incrementando el valor de los clientes Z39.50, que ya pueden acceder a una masa crítica de recursos. Bookwhere 2000 Sea Change (www.bookwhere.com) EzCat BookSystems (www.booksys.com/ezcat) ZNavigator EnWare (www.enware.es) ZSearch Infoworks Technology (www.itcompany.com) ZPista Ifgenia Plus (www.ifigenia.es/zeta)

Agentes inteligentes: estos programas se han convertido en herramientas muy populares en Internet, que permiten superar algunos de los problemas tradicionalmente asociados a los motores de búsqueda. No todos los agentes ofrecen acceso a recursos de la Internet invisible e incluso aquellos que así lo hacen lo presentan como opciones avanzadas, normalmente no disponibles en las versiones “shareware”. BullsEye Intelliseek (www.intelliseek.com) Copernic Copernic (www.copernic.com) EZSearch American Systems (www.americansys.com) LexiBot BrightPlanet (www.lexibot.com) WebSeeker Blue Squirrel (www.bluesquirrel.com)


LARA Navarra, Pablo, MARTINEZ Usero, José Ángel. Agentes inteligentes en la búsqueda y recuperación de información. 2004. p.16. Disponible en: http://eprints.rclis.org/bitstream/10760/7941/1/2004-Lib-Agentes.pdf

viernes, 8 de abril de 2011

Búsqueda y Recuperación de Información - Motores de Búsqueda

Los motores de búsqueda


Los motores de búsqueda o buscadores tienen sus antecedentes en los simples listados de direcciones de recursos y documentos de la red, y son la respuesta al rápido volumen de crecimiento dela red, que supera la capacidad de los recursos humanos de los directorios – que por ello suelen ser selectivos -.


Los buscadores son bases de datos creadas por indización automática del texto completo de las páginas web, y realizada por un programa llamado robot. Este robot lógico, o araña (spider), explora de forma automática los servidores, extrayendo las palabras más significativas de cada página y creando un índice de búsqueda. Aun cuando los programas lleguen a ser similares, no existen dos programas de búsqueda exactamente similares en términos de tamaño, velocidad y contenido; no existen dos motores de búsqueda que utilicen coincidentemente el mismo listado de relevancia y tampoco cada motor de búsqueda ofrece las mismas opciones de búsqueda. Por lo tanto, su búsqueda resultará diferente en cada motor utilizado. La diferencia podría no ser mucha, pero sí significativa Existe una gran porción de la red que las “arañas” de los buscadores no pueden o no alcanzan a indizar. Se las nombra como la "Red Invisible " o la "Red profunda" e incluye, entre otras cosas, sitios protegidos por contraseñas, documentos detrás de “cortinas de fuego”, material archivado, herramientas interactivas, y los contenidos de ciertas bases de datos.


Los servicios de consulta basados en directorios y motores de búsqueda han ido incorporando prestaciones, y han evolucionado hacia lo que actualmente se llaman portales, un conjunto de servicios que pretende satisfacer todas las necesidades de los usuarios de Internet (cuentas de correo electrónico, chat, páginas amarillas y blancas, información metereológica y de la bolsa, servicio de noticias).


LARA Navarra, Pablo, MARTINEZ Usero, José Ángel. Agentes inteligentes en la búsqueda y recuperación de información. 2004. p. 6. Disponible en: http://eprints.rclis.org/bitstream/10760/7941/1/2004-Lib-Agentes.pdf

Búsqueda y Recuperación de Información http://informationrecuperation.blogspot.com

1. Los motores de búsqueda y la recuperación de la información
La recuperación de la información (RI) es una operación en la que se interpreta una necesidad de información de un usuario y se seleccionan los documentos más relevantes capaces de solucionarla. En el contexto de Internet, se puede definir el objetivo de la recuperación como la identificación de una o más referencias de páginas web que resulten relevantes para satisfacer una necesidad de información.

1.1. El lenguaje de interrogación Un lenguaje de interrogación es el conjunto de opciones (órdenes, operadores y estructuras) que, organizados según normas lógicas, permiten la consulta de los recursos de información mediante una expresión, llamada ecuación de búsqueda.



  • Las órdenes son aquellas palabras o abreviaturas que indican al sistema las acciones a ejecutar (buscara la expresión, mostrar los registros resultantes de una búsqueda, ejecutar un perfil de usuario...)


  • Los operadores son los encargados de expresar las relaciones que mantienen entre sí los términos que pueden definir las necesidades informativas del usuario. Si bien inicialmente las ecuaciones de búsqueda se formulaban mediante la formulación textual de expresiones, la implantación de interfaces gráficas a partir de los años 80 llevó al uso de nuevos entornos de selección, donde el usuario sólo debe introducir los términos y guiarse por un sistema de botones y menús desplegables.

1.1.1. Operadores lógicos o booleanos Llamados así en honor a George Boole, matemático del siglo XIX que fue el precursor de la lógica simbólica y el álgebra de Boole (teoría de conjuntos), es uno de los métodos más extendidos de especificar las búsquedas en la mayoría de sistemas. Se basan en tres operaciones lógicas básicas:




  • Intersección de conjuntos :AND/ Y Operador que indica que deben estar incluidos en los resultados de la búsqueda los términos unidos por esta partícula. Es un operador restrictivo, puesto que elimina aquellos documentos en los que no aparecen todos los términos de la expresión de búsqueda. Ejemplo: bullseye AND copernic, indica que deben aparecer en el documento las dos palabras si no es así se excluirá el documento.


  • Unión o suma de conjuntos : OR / O Indica que cualquiera de las palabras que estén unidos por este operador debe aparecer en el documento, las restantes no tienen que estar presentes. Es un operador de ampliación, pues sólo deberá aparecer uno o alguno de los términos de la expresión de búsqueda. Ejemplo: bullseye OR copernic, puede aparecer en el documento la palabra bullseye o copernic o ambas


  • Exclusión de conjuntos: NO/ AND NOT Operador que excluye de un documento la palabra no deseada. Es un operador de restricción, pues se seleccionan aquellos documentos que contienen el primer término de búsqueda, pero no el segundo. Ejemplo: Knowbots AND NOT copernic, recupera todos los documentos que contengan la palabra Knowbots pero que no contengan la palabra copernic. En la elaboración de una ecuación de búsqueda es habitual la combinación de más de uno de estos operadores, por lo que será necesario conocer en profundidad el sistema para saber las prioridades a la hora de su ejecución, puesto que los resultados pueden variar sustancialmente. A menudo, estas prioridades vienen marcadas por el uso de paréntesis, de manera que se ejecuta en primer lugar el operador que une los términos que están entre paréntesis. Ejemplo: (bullseye OR copernic OR lexibot) AND (agentes inteligentes), recupera los documentos que contengan los terminos agentes inteligentes y copernic o bullseye o lexibot.

1.1.2. Operadores posicionales Los operadores posicionales toman como partida la posición del término en relación a su contexto, es decir, en relación a los otros términos y al documento. Estos operadores se pueden dividir en dos tipos: los relativos y los absolutos.


1.1.2.1. Operadores posicionales relativos A menudo llamados operadores de adyacencia o proximidad. Permiten definir al sistema de búsqueda la distancia que puede existir entre un término y otro. Se pueden buscar términos que estén juntas, separadas por varias palabras o caracteres, que se encuentren en una misma frase o un mismo párrafo, e incluso si se debe o no respetar el orden de los términos. Existe una gran variedad de operadores de adyacencia, y expresan diferentes situaciones según los sistemas.




  • NEAR, operador que obliga a estar a un número determinado de distancia las palabras claves a recuperar. Este número varía en función de los diferentes programas de recuperación de la información: así, por ejemplo, mientras en Altavista significa un máximo de 10 palabras entre los términos, en WebCrawler significa un máximo de 2 palabras. Ejemplo: bullseye NEAR copernic recupera textos con frases como “bullseye es mejor que copernic” o “copernic tiene más motores que bullseye”


  • NEAR/N, realiza la misma operación que NEAR, pero N es sustituido por la distancia en palabras que deben estar separados los términos de búsqueda. Ejemplo: bullseye NEAR/5 copernic, recupera todos los documentos que aparezcan los dos terminos y cuya separación no sea mayor a cinco palabras.

LARA Navarra, Pablo, MARTINEZ Usero, José Ángel. Agentes inteligentes en la búsqueda y recuperación de información. 2004. p.6-7. Disponible en: http://eprints.rclis.org/bitstream/10760/7941/1/2004-Lib-Agentes.pdf

Proceso de elaboracion de un buscador

El tema de la clase de recuperacion de informacion estuvo basada en como se debe realizar un buen buscador eficiente que consolide fuentes de informacion relevantes sobre bibliotecas, archivos, centros de informacion por paises, y de esta manera evidenciar las riquezas de los contenidos ( libros, revistas, tesis, OVAS ). Un primer paso es revisar todos los repositorios y directorios de cada pais. Sobre las URL recopiladas se debe acceder a google y buscar en cada recurso cuales son los teminos que mas se utilizan para recuperar información Luego se puede realizar la busqueda en google agregando las palabras relevantes con operadores OR que significa encuentre esto o esto, tambien el operador AND que significa encuentre esto y esto osea une; existen muchos operadores que limitan o amplian las busquedas segun se requiera. Esta informacion nos permitirá descubrir las formas mas eficientes de recuperar informacion y debe depositarse en una plantilla. Por el momento les dejamos estos tips que iremos complementando en la medida que avancemos. ¡Esten pendientes!

lunes, 4 de abril de 2011

Que es meta-biblioteca

Metabiblioteca es un portal desarrollado alrededor de una comunidad de personas e instituciones en las cual se incluyen estudiantes, profesionales y expertos del área de los sistemas de información, bibliotecología y archivística, lo ideal es proponer nuevos proyectos para construir productos y servicios de información para bibliotecas y archivos.

Una primera iniciativa es realizar buscadores por países que sean eficientes en la recuperación de información y lo haremos en la clase de recuperación de información.

¡esperen nuestros resultados!


jueves, 31 de marzo de 2011

SISTEMAS DE RECUPERACIÓN DE INFORMACIÓN

La recuperación de información nace de la necesidad de resolver un problema, anteriormente cuando no habia maquinas y los procesos eran manuales en las bibliotecas se usaban ficheros e indices pero con el paso del tiempo y la evolución de las tecnologias, los volumenes de información aumentarón y se hizo necesaria la utilización de maquinas que permitan realizar el proceso de buscar, indizar, determinar relevancias, preguntas etc., de alli la creación de los Sistemas de Recuperación de Información (SRI).


Entonces recuperación de información a las luz de los SRI son todos los procesos automatizados que permiten solucionar una necesidad de información, en donde el usuario accede a documentos relevantes y le entrega resultados mas alla del termino exacto introducido en la búsqueda.


De esta manera un SRI recupera documentos Relevantes es decir, que son importantes dentro de un tema, aunque el estado ideal sería que el sistema entregara documentos pertinentes por los volumenes de información no es tan sencillo de hacer.

martes, 29 de marzo de 2011

¿Se puede recuperar los metadatos de las imágenes?


esto se puede lograr con las tic´s y la visión que como profesionales de información debemos tener en la búsqueda y recuperación de información, les compartimos un ejemplo aplicado.

¿Quiero saber cómo hago para buscar en algún sitio de Internet y saber a qué lugar corresponde esta fotografía?

Realice la búsqueda en google por programas que reconozcan imágenes en la Web y me arrojo entre las primeras TinEye http://www.tineye.com/ “reverse imagen search” tiene dos opciones subir la imagen, si es así se puede utilizar picture manager de office o ingresar la URL y el busca las páginas de origen. 

Se sube la imagen e inicia el reconocimiento como resultado entrega las paginas similares o de origen, que es la página inmagine www.inmagine.com allí aparecen las imágenes más parecidas hasta que localizamos la que necesitamos, todas tienen un recuadro que tiene los datos descriptivos como el lugar, la cantidad de imágenes relacionadas con el país o región, el costo y una numeración acompañado de las siglas ICN. Se elige la imagen ICN169052 y ahí ya muestra la foto y en la parte inferior dice “Reunión, woody mountains inside the island, aerial view” http://www.inmagine.com/icn169/icn169052-photo además si uno desea adquirir la foto puede solicitarla en varios tamaños y de allí una variable en el costo, de ahí realice la búsqueda en google y aparecen 135.000 resultados en el primer resultado esta fotosearch y http://www.fotosearch.com/ICN291/f0027155/
 
Entre otros resultados que arrojan la imagen asociada al titulo.

LOS DOCUMENTOS DE TEXTO Y SU ESTRUCTURA

Despues de la lectura del segundo capítulo los documentos y su estructura se presenta a ustedes un breve resumen de este articulo

Una de las formas de expresar el conocimiento es a través de documentos que tengan texto que permiten expresar un conocimiento y tienen un estilo de presentación. 

Esto se conoce como estructura existen unos metadatos que son un conjunto de datos que describen el documento de texto y a veces se representan con lenguajes de marcado. 

La estructura de los documentos se puede definir como un orden que permite realizar una clasificación en estructurados semiestructurados y no estructurados. 

En los documentos no estructurados la información no puede ser dividida o clasificada mostrando una estructura, titulo, resumen etc., funciona como un único dato, puesto que no encuentra diferenciación en su contenido, por tanto es necesario transformarlo para extraer la información de manera rápida y precisa. 

En cuanto a los documentos semiestructrados se agrega una marca al documento que es un dato adicional, como una etiqueta que permite delimitar el texto sin embargo estos documentos siguen siendo flexibles. 

Los metadatos son “los datos de los datos”, por ejemplo los índices, fichas de catalogo y resúmenes pueden considerarse todo metadatos. Que a su vez responden a una funcionalidad, contexto y generador (interlocutor). Para los cuales se generan cada vez más estándares como XML para crear y compartir datos. 

Se han generado muchas formas de clasificar los metadatos sin embargo hay dos muy acertadas, los semánticos que son producto de la información que contiene el documento, y los metadatos descriptivos que son los de Indización diferentes al documento. 

Las marcas ayudan a describir la información y son herramientas fundamentales para la estructuración de documentos el lenguaje de marcación más popular que es HTML. 

El objetivo de conocer la estructura de los documentos, el uso de metadatos y las diferentes formas de realizar marcaciones facilitaran la búsqueda de información en los documentos de texto, para disponer de la información con inmediatez y que sea útil se puede realiza de dos formas recuperar (IR) y extraer información (IE), en el primero se entregan los documentos relevantes y en el segundo se evidencian las características o metadatos de los documentos.