Vistas de página en total

Buscar este blog

Mostrando entradas con la etiqueta busqueda y recuperacion de informacion. Mostrar todas las entradas
Mostrando entradas con la etiqueta busqueda y recuperacion de informacion. Mostrar todas las entradas

miércoles, 4 de mayo de 2011

BÚSQUEDA DE INFORMACIÓN EN INTERNET - Búsqueda y Recuperación de Información

BÚSQUEDA DE INFORMACIÓN EN INTERNET



Margarita Lugo Rocha


Las TIC ofrecen una gran cantidad de recursos educativos que pueden ser utilizadas entre otras cosas, para la búsqueda de información en Internet.



1. Lo primero que tienes que hacer es que tu computadora tenga acceso a internet.

2. Después utilizarás un navegador que puede ser Mozilla Firefox o Internet Explorer o cualquier otro que tengas y que puedes identificar en tu computadora con los iconos:




3. Ahora vamos a entrar al buscador Google, esto lo haces escribiendo en la barra de direcciones: www.google.com.mx y aparecerá la siguiente ventana




4. Deberás tener claro ¿Que se debe hacer para realizar una búsqueda?


Objetivo claro de la búsqueda (qué y por qué) Saber dónde se va a buscar (cómo y dónde) Utilizar palabras clave adecuadas Confiabilidad de la información (qué he encontrado)


5. Durante la búsqueda es muy importante el uso de las comillas, así al digitar “10 de abril de 1919”, recibimos información únicamente de lo acontecido en esta fecha.


6. También podemos recurrir a la pestaña de imágenes de Google, para ubicar las que se requieran en el trabajo.


7. Una vez encontradas las imágenes que se quieren, ubicamos el cursor sobre la imagen, damos clic en botón derecho y clic en salvar la imagen como. Ubicamos el lugar de nuestra computadora en donde la queremos guardar, se le proporciona un nombre a la imagen y listo:


8. Es muy importante que la información que buscamos sea confiable, para ello buscaremos referencias de instituciones como la UNAM, o que en la liga tengan gob o de sitios que contienen información objetiva y fiable, es decir, se deben usar las direcciones propias de lo que estamos buscando, es decir si quiero algo sobre la UNAM, deberé buscar en su propia página.


9. En la búsqueda de información, para ir acotándola, también es necesario utilizar la búsqueda avanzada, en el cual se utilizan las palabras claves o indicadores de búsqueda y también es útil determinar los operadores lógicos (and, not, or) o los limitadores de campo que se van a emplear, los cuales nos sirven para unir o discriminar tipos de información.

A continuación se presentan algunos ejemplos:








10. Para entrar en la búsqueda avanzada das clic en donde dice búsqueda avanzada: a continuación se presenta la pantalla de la búsqueda avanzada con el buscador google.

lunes, 25 de abril de 2011

Búsqueda y Recuperación de Información - Indización Social

Indización Social y Recuperación de Información




HASAN, Montero Yusef. Indizacion social y recuperación de información. (Termino de busqueda: indización y recuperación de información). 2011-04-25. Disponible en: http://www.nosolousabilidad.com/indizacion_social.htm





Con la aparición en la Web de las herramientas de bookmarking social (como del.icio.us), se populariza un nuevo modelo para organizar, describir y compartir recursos web, denominado tagging o etiquetado social. Como primera definición operativa podemos decir que el tagging es aquel proceso distribuido en el que los recursos u objetos son descritos o caracterizados por medio de tags (términos o conjuntos de términos en lenguaje natural). Al resultado agregado de este proceso se le denomina folksonomía, que significaría “clasificación hecha por el pueblo” (Quintarelli; 2005).




El tagging tiene dos dimensiones interrelacionadas: la personal y la colectiva. En su dimensión personal, el tagging es un proceso de indización o categorización de recursos cuya principal motivación es de carácter egoísta: el usuario etiqueta los recursos para poder recuperarlos posteriormente (Cañada; 2006). Es decir, cada usuario confecciona su propio índice personal de tags (personomía) para su colección personal de recursos.



Puesto que el tagging suele llevarse a cabo en un entorno compartido, tiene además una dimensión social o colectiva: los usuarios comparten sus tags y recursos, generando mediante colaboración implícita un índice global de tags (folksonomía) a través del que cualquier persona podrá recuperar cualquier recurso descrito por otros usuarios. Esta dimensión social es la que le confiere al tagging su mayor potencial en áreas como la Recuperación de Información (entre otras).


A continuación se contextualiza y define el concepto de indización social, con el objetivo de poder abordar sus características, ventajas, desventajas e implicaciones para la recuperación de información.


Indización Social






La indización es el proceso de analizar el contenido de los documentos (recursos, imágenes, textos, etc.) y asignarle términos descriptivos, generando un índice de puntos de acceso a través del cual poder recuperar dichos documentos.



La distinción entre tipos de indización se suele realizar en función de cómo se realiza el proceso, dando pie a dos grandes categorías: indización humana e indización automática.


La indización humana es un proceso intelectual, donde es una persona (tradicionalmente un indizador profesional) quien, tras analizar el contenido del documento o parte del documento, le asigna aquellos términos de indización que considera identifican las temáticas principales de su contenido.



La indización automática, por el contrario, es realizada por algoritmos que mediante diversas técnicas o métodos determinan cuál es el peso con el que cada uno de los términos que aparecen en el documento representa su contenido temático.


La indización humana y la automática ofrecen resultados diferentes, aunque igualmente válidos (Anderson, Pérez-Carballo; 2001). Sin embargo, la automática posee una destacable ventaja frente a la humana: su menor coste. Por esta razón resulta la única opción plausible en colecciones de gigantesco volumen y constante crecimiento (como es la propia Web).



La indización humana únicamente puede aplicarse sobre colecciones dinámicas y de gran volumen a través de la distribución de la tarea de indizar entre el máximo número de individuos posibles. Un modelo de distribución del trabajo sería la indización realizada por los autores o creadores de los recursos. En la Web tenemos ejemplos claros de este modelo, como el empleo de las metaetiquetas en páginas HTML o el tagging de autor-creador (flickr).



La indización social representaría un nuevo modelo de indización, en el que son los propios usuarios o consumidores de los recursos los que llevan a cabo su descripción - lo que Mathes (2004) denomina metadatos generados por el usuario -. La descripción de cada recurso se obtendría por agregación, es decir, un mismo recurso sería indizado por numerosos usuarios, dando como resultado una descripción intersubjetiva y por tanto más fiable que la realizada por el autor del recurso, e incluso por un profesional.



Otra diferencia de la indización social frente a la individual es que ya que los recursos son indizados independientemente por varias personas, el resultado del proceso será más exhaustivo, es decir, se asignará un mayor número de términos de indización diferentes a cada recurso. Al ser más exhaustiva la indización, es más consistente, mitigando el tradicional problema de la inconsistencia en la indización profesional. Sin embargo, esta exhaustividad no será proporcional: habrá recursos con muchos tags asignados, y recursos con muy pocos tags (Hassan; 2006b).




Por ello, para explotar el verdadero potencial de la indización social en recuperación de información, este modelo de indización debe ser considerado un híbrido entre la indización humana y la automática. Por un lado es resultado de un proceso intelectual (humano) distribuido, pero al mismo tiempo si no se aplican algoritmos de ponderación, el resultado “en bruto” de la indización social contendrá excesivo ruido y ambigüedad semántica como para resultar de utilidad colectiva.


Palabras clave o Categorías




Cuando se trata de definir qué son los tags, algunos autores los asemejan a categorías mientras que otros a palabras clave. La distinción conceptual entre palabras clave y categorías, y por tanto entre descripción y clasificación, es básicamente una cuestión de especificidad.



Las categorías representan la temática global bajo la que se enmarca un recurso, mientras que las palabras clave describen aquellos conceptos que son tratados en el recurso (Hassan, Núñez-Peña; 2005).



Ya que es una cuestión de especificidad, podemos darle una interpretación estadística, partiendo de las medidas de especificidad del término (número de recursos web que representa) y exhaustividad de la indización (número de términos asociados al recurso) (Spärck Jones; 1972). Es decir, es una cuestión de proporcionalidad entre el número de recursos de la colección y el número de términos diferentes presentes en el índice.



Así, la descripción por palabras clave daría lugar a términos de indización más específicos e indizaciones de recursos más exhaustivas, mientras que su categorización daría lugar a términos más genéricos e indizaciones menos exhaustivas.



Distinguir entre palabras clave y categorías sería una cuestión completamente trivial si no fuera porque dependiendo de la naturaleza de la indización, ésta resultará de mayor utilidad para ofrecer sistemas de búsqueda (querying) o, por el contrario, sistemas de navegación (browsing). De este modo, la descripción por términos más específicos será más adecuada para sistemas de búsqueda, mientras que los términos más genéricos (categorización) son más apropiados para ofrecer sistemas de navegación.


¿Por qué es así?



El querying (interrogación de un buscador) es una estrategia de búsqueda que el usuario utiliza cuando tiene bastante claro qué está buscado (y sabe expresar sus necesidades de información mediante una consulta). El browsing (exploración o navegación), en cambio, es una estrategia para búsquedas de propósito general, en las que el usuario prefiere reconocer qué está buscando.


La indización por términos más específicos ofrece mayor precisión en los resultados, proporcionando al usuario pocos resultados pero relevantes, y satisfaciendo necesidades de información concretas.


En cambio, la indización por términos genéricos ofrece mayor exhaustividad, proporcionando mayor cantidad de resultados relevantes, pero también de no relevantes.



Naturaleza y utilidad de los tags


El tagging se encuentra en un término medio entre la descripción y la categorización. Si bien la indización social resulta más exhaustiva que la indización humana (individual), y por tanto genera un índice de términos más específicos, el tagging es un proceso mucho menos exhaustivo que la indización automática. Esto es así porque en la indización automática, a priori, todos los términos que aparecen en el cuerpo textual del documento son candidatos para formar parte de su descripción.


Esto significa que la indización social no resultará más pertinente que la automática para la recuperación de información por consulta mediante buscador (siempre y cuando estemos tratando recursos o documentos de naturaleza textual o con alguna descripción textual, y por tanto indizables automatizadamente). De hecho, la mayoría de sistemas basados en tagging ofrecen como opción primaria de búsqueda la basada en indización automática a texto completo, y no por tags.



Aún así, un buscador podría enriquecerse con el conocimiento subyacente en las folksonomías: relaciones semánticas entre tags (análisis de co-ocurrencias) y grados de relevancia, autoridad, o interés potencial de los recursos.



Conclusión


A modo de resumen, podemos concluir:



Sólo podemos hablar de un nuevo modelo en aquellos sistemas que permiten la indización social agregada, es decir, donde varios usuarios indizan un mismo recurso. El tagging de autor, donde son los creadores de los recursos los que asignan los tags (fotos en flickr, tags en blogs…) no representa un modelo innovador.



De cara a la recuperación de información, es esta dimensión social del tagging la que ofrece mayores expectativas: descripción intersubjetiva, mayor exhaustividad y consistencia en la indización, y posibilidad de extraer relaciones de semántica subyacente.



Ya que los tags se asignan de forma completamente libre y con diversas motivaciones, resulta necesario el empleo de algoritmos de ponderación y de eliminación de tags vacíos de significación colectiva.



Los tags tienen una naturaleza genérica, por lo que los índices de tags son más apropiados para ofrecer sistemas de navegación que sistemas de búsqueda. Esto no significa que los sistemas de búsqueda no puedan enriquecerse con el conocimiento latente de las folksonomías, pero sí que un sistema de búsqueda basado exclusivamente en los términos asignados por tagging ofrecerá unos ratios de precisión muy bajos, además de silencio en la recuperación (para muchas búsquedas no habrá resultados, o ninguno será relevante).



Los actuales sistemas de navegación basados en tagging tienen una utilidad y usabilidad bastante limitada. Tal es el caso de los Tag-Clouds o nubes de etiquetas.




Bibliografía


Abadal, E.; Codina, L. (2005). Recuperación de Información. En: Bases de Datos Documentales: Características, funciones y método. Capítulo 2. p. 29-92. Madrid: Síntesis, 2005. Disponible en:




Anderson, J.D.; Pérez-Carballo, J. (2001). The nature of indexing: how humans and machines analyze messages and texts for retrieval. Information Processing and Management, 37, 2001, pp. 231-254.

Baeza-Yates, R.; Ribeiro-Neto, B. (1999). Modern Information Retrieval. Addison-Wesley, Wokingham, UK, 1999.

Barrero, V.; Seoane, C. (2005-2006). Anotaciones publicadas sobre folksonomías y tagging. Deakialli DocuMental. Disponible en:


Blat, F. (2006). Tag relacionados: aproximaciones. In web we trust. Disponible en:


Cañada, J. (2006). Tipologías y estilos en el etiquetado social. Terremoto.net: Diseño de interacción desde el año 2000. Disponible en:


Hassan, Y. (2006a). Visualización y Recuperación de Información. II Encontro de Ciências e Tecnologias da Documentação e Informação. 27 Abril, 2006. Disponible en: http://www.nosolousabilidad.com/hassan/visualizacion_y_recuperacion_de_informacion.pdf

Hassan, Y. (2006b). Consistencia inter-tagging. VéaseAdemás. Disponible en:


Hassan, Y.; Herrero, V. (2006). Improving Tag-Clouds as Visual Information Retrieval Interfaces. InSciT2006: Mérida, Spain. 25-28 de Octubre, 2006. Disponible en:


Hassan, Y.; Núñez-Peña, A. (2005). Diseño de Arquitecturas de Información: Descripción y Clasificación. No Solo Usabilidad Magazine. 14 de Enero de 2005. Disponible en: http://www.nosolousabilidad.com/articulos/descripcion_y_clasificacion.htm




Mathes, A. (2004). Folksonomies - Cooperative Classification and Communication Through Shared Metadata. Unpublished paper. Disponible en:






Quintarelli, E. (2005). Folksonomies: power to the people. ISKO Italy-UniMIB meeting: Milan. June 24, 2005. Disponible en:






Rijsbergen, C.J. (1975). Information retrieval. London: Butterworths, 1975. Disponible en: http://www.dcs.gla.ac.uk/Keith/Preface.html



Sinha, R. (2005). A cognitive analysis of tagging. Rashmi Sinha Blog. Disponible en: http://www.rashmisinha.com/archives/05_09/tagging-cognitive.html



Spärck Jones, K. (1972). A statistical interpretation of term specificity and its application in retrieval. Journal of Documentation, 28 (1), 1972, 11-21.






martes, 19 de abril de 2011

La recuperación de datos también está en la nube - Búsqueda y Recuperación de Información

La compañía Kroll Ontrack, proveedor de gestión de información y recuperación de datos para el entorno legal, ha anunciado la mejora y ampliación de su servicio de recuperación de datos Ontrack para sistemas Oracle, incluyendo los entornos virtuales. El soporte de Kroll Ontrack proporciona a miles de usuarios un recurso profesional en situaciones de pérdida de datos.

La encuesta Database Trends and Applications revela que nueve de cada diez usuarios de bases de datos Oracle han visto cómo sus bases de datos han crecido, y el 6 por ciento afirma que ese aumento ha sido del 50 por ciento anual o incluso mayor. Además, según Oracle, el 98 por ciento de las empresas que engrosan la lista Fortune 500 utilizan actualmente bases de datos Oracle. A medida que crece el número de empresas que utilizan estas bases de datos, aumenta la necesidad de proveedores especializados en recuperación de datos que conozcan estos sistemas.

Cuando las bases de datos se encuentran en la nube o en el interior de máquinas virtuales, la recuperación de datos es más compleja. Kroll Ontrack, para ayudar a las empresas a mitigar estos riesgos de almacenamiento y gestión de datos, ofrece soporte para la pérdida de datos en entornos Oracle, que se suelen producir sobre todo por error humano o daños de hardware.

Kroll Ontrack es compatible con la mayor parte de los tipos de bases de datos Oracle utilizados en la actualidad, incluidas las versiones 8, 8i, 9i, 10g y 11g que se ejecutan en plataformas x86 y Solaris. Esto proporciona a los usuarios una solución de recuperación que puede adaptarse a sus configuraciones de hardware.

Acceder a contenidos "perdidos" por corrupción de bases de datos y registros de acceso Oracle, por daños en los sistemas de gestión automática de almacenamiento (ASM) son algunas de los servicios de la compañía. Kroll Ontrack puede recuperar datos Oracle almacenados en grupos de discos ASM, incluidos aquellos casos en los que las estructuras de volumen de ASM se han dañado o sobreescrito.

Kroll Ontrack también trabaja con bases de datos perdidas o eliminadas. Los especialistas en recuperación de datos de Ontrack pueden recuperar archivos de bases de datos Oracle eliminados o perdidos, incluso si se han sobreescrito los metadatos. Con herramientas y procedimientos patentados, los técnicos buscan en el espacio libre para localizar todos los datos de Oracle en bruto, reconstruir los archivos de bases de datos originales y extraer la información, lo que permite al cliente importar dichos datos en una nueva base.

Los escenarios de pérdida de datos abarcan toda clase de situaciones, desde fallos de hardware hasta la eliminación de entradas en bases de datos. Con opciones de servicio de recuperación en el laboratorio, a distancia y en la empresa, Kroll Ontrack presta estos servicios de forma rápida y se adapta a cualquier situación de pérdida de datos Oracle. La empresa también ofrece un servicio al cliente ininterrumpido en 14 idiomas.

"Gracias a las mejoras de nuestra tecnología de recuperación de datos Ontrack, Kroll Ontrack es capaz de recuperar datos en numerosos escenarios de pérdida de datos Oracle, ya sea una sola base de datos o una instalación empresarial compleja", ha declarado el director de Kroll Ontrack en España, Nicholas Green. "Estas mejoras ayudarán a las empresas a garantizar la recuperación de datos críticos esenciales para la continuidad de su actividad".






PORTARTIC.ES.La recuperación de informacion tambien esta en la nube. 2011-04-16.


Disponible en:http: //www.europapress.es/portaltic/sector/noticia

viernes, 15 de abril de 2011

Búsqueda y Recuperación de Información - Guia Promocional



Publicada una guía para promover la comunicación en las familias sobre uso adecuado internet, móvil y videojuegos


El consejero de Salud del Gobierno de La Rioja, José Ignacio Nieto, ha presentado esta mañana la nueva guía para padres 'Habla con ellos de las tecnologías: Internet, móviles y videojuegos', con el objetivo de facilitar la comunicación en las familias riojanas para promover un uso seguro y responsable de las nuevas tecnologías por parte de los hijos adolescentes.




La guía, de la que se han editado 2.000 ejemplares, se va a distribuir en las escuelas de padres, institutos, colegios, bibliotecas, asociaciones y ONGs del ámbito de las drogodependencias de La Rioja, así como a aquellas personas que soliciten información específica sobre este tema en el Servicio de Drogodependencias de la Consejería de Salud, que está ubicado en la calle Gran Vía, 18, de Logroño (y en el teléfono gratuito 900 714 110).

Este material se dirige a las familias interesadas en aprender pautas concretas de actuación con sus hijos con respecto al buen uso de las tecnologías.

En el caso de la presente guía, las tecnologías pueden causar problemas de abuso o adicciones denominadas 'no tóxicas', es decir, que determinadas personas sufren angustia, ansiedad, nerviosismo o irritabilidad una vez que dejan de jugar o utilizar el móvil o de usar Internet, ha destacado el consejero.

Importantes cambios en la sociedad

Salud ha editado la guía con el ánimo de abordar la problemática con la que muchos padres se enfrentan y por la cual demandan ayuda, de poder hablar y orientar a sus hijos adolescentes acerca del uso de las tecnologías.

Las Tecnologías de la Información y la Comunicación (TIC's) han generado importantes cambios en nuestra sociedad. Estas tecnologías consisten en una variada gama de instrumentos, herramientas, canales y soportes dedicados esencialmente al uso, manejo, presentación, comunicación, almacenamiento y recuperación de información. En cuanto a los adolescentes y jóvenes se refiere, al hablar de nuevas tecnologías la guía se centra, principalmente, en el uso de Internet, videojuegos y teléfonos móviles. Por esta razón, desde hace un tiempo, Salud está apostando por la prevención de este uso inadecuado de las nuevas tecnologías, dado que la mejor manera de evitar un problema es enseñar a los jóvenes a hacer un uso seguro y responsable de ellas.

El objetivo de la presente guía es ayudar a los padres en esta labor. Además, la guía incluye también pautas de actuación y recomendaciones concretas para fomentar que la familia sea un centro de referencia, un lugar que ofrezca apoyo y seguridad a los hijos para lograr este uso adecuado de las tecnologías.

La Guía sigue una metodología muy práctica a través de orientaciones clave para los padres sobre qué hacer y cómo actuar, ejemplos explicativos de situaciones concretas y cuadros resumen que resaltan las ideas más importantes de cada apartado.

En los anexos de la guía se puede encontrar información sobre los sistemas de clasificación de los videojuegos y el control de los padres. Asimismo, en la parte final de la guía hay un pequeño glosario que puede ayudar a conocer el significado de algunos términos importantes sobre las adicciones y las tecnologías. Toda esta información se completa con una recopilación de todos los organismos implicados en la asistencia a las drogodependencias, con el fin de facilitar a las personas interesadas en la guía direcciones y teléfonos a los que dirigirse en caso de dudas.



20 minutos.es. publicada guia promover la comunicacion en las familias sobre uso adecuado de internet, movil y videojuegos.2011-04-10. Disponible en: http://www.20minutos.es/noticia/1018452/0/



Mas Búsqueda y Recuperación de Información: http://informationrecuperation.blogspot.com/

Microsoft le arrebata terreno a Google en el mercado de las búsquedas

Microsoft le arrebata terreno a Google en el mercado de las búsquedas

Buenas noticias provenientes de Estados Unidos le llegaron esta semana a la gente de Microsoft. Todo indica que la estrategia para posicionar mejor su motor de búsquedas Bing está dando resultados y, según el informe más reciente de la firma Experian Hitwise, en los últimos meses Bing logró quitarle una buena porción del mercado a Google en el país.

El estudio de la empresa de análisis de mercado y estadísticas que funciona en Estados Unidos, Canadá y Brasil, entre otros, concluyó que las búsquedas hechas por los usuarios con el motor de búsquedas Bing (en Bing.com y Yahoo.com) alcanzan el 30,01% del total registrado en marzo de este año en el mercado, lo que lleva a suponer que la alianza entre Yahoo! y Bing estaría dando los resultados esperados por Microsoft.

A comienzos del mes pasado, ENTER.CO dio a conocer las cifras de los buscadores en el mundo. En esa ocasión, el motor de búsquedas de Microsoft también logró quitarle el segundo lugar en el ranking a Yahoo! Sin embargo, esta vez la sorpresa gira en torno al porcentaje de mercado que le quita Bing a Google, que bajó del 66,69% al 64,42%.

Las cifras reflejan el comportamiento del mercado solo en Estados Unidos, pues en otras regiones del mundo, como Latinoamérica, Google supera el 90% del mercado. Es necesario dejar claro que Experian Hitwise coincide con comScore en la tendencia de pérdida de mercado del gigante de las búsquedas, mientras que StatCounter en sus cifras muestra estabilidad de Google.


DIAZ, Carlos Alberto. Microsoft le arrebata terreno a Google en el mercado de las búsquedas. 2011-04-12. p.12. Disponible en: http://www.enter.co/internet/microsoft-le-arrebata-terreno-a-google-en-el-mercado-de-las-busquedas/

miércoles, 13 de abril de 2011

Search and Recovery Information - Búsqueda y Recuperación de Información

Search and recovery information

Recuperación de Información (Consejos para la búsqueda)


l. pensar antes de buscar Antes de utilizar el motor de búsqueda, primero analice que desea buscar, que palabras son las más utilizadas y trate de ser concreto en lo que desea con ello minimizara la posibilidad de recibir toneladas de " información”. Y de esta manera tendrá mayor satisfacción de localizar lo que requería.

2. Elegir el motor de búsqueda Busque y elija la herramienta acorde a sus necesidades, compare las fortalezas y debilidades y sáquele el mayor provecho


3. Aprender a utilizar tanto en la búsqueda de palabras clave Para limitar los resultados de la búsqueda y hacerla mas refinada se pude encerrar los términos o palabras clave encerradas entre “” de esta manera los resultados pueden ser mas exactos. Ej." Pekín turismo”.


4. Aprender a utilizar el signo menos " -” "-" El signo menos tiene la función de eliminar los resultados de búsqueda irrelevantes para mejorar la relevancia de los resultados. Por ejemplo, usted está buscando, " Shenhua " información de la empresa, escriba " Shenhua " ha encontrado un montón de noticias de fútbol Shenhua, en el que una característica común de las noticias es " fútbol “, escriba " Shenhua - Fútbol " para buscar, ya no tendrá física de noticias para la educación en tu camino.


5. Pensar antes de hacer clic en los resultados de búsqueda Revise el listado de resultados antes de hacer clic en cualquiera de ellos, lea los encabezados y la URL, esto le ayudará a seleccionar los resultados más precisos, y a evaluar la calidad y la autoridad del contenido de la Web.


6. Palabras clave: con demasiada frecuencia Cuando las palabras son muy comunes por ejemplo “teléfono” puede aparecer muchísima información así que trate de complementar esta palabra con otra “termino compuesto” para que la exactitud sea mayor en la recuperación de información.


7. La polisemia Tenga cuidado de utilizar palabras ambiguas, tales como la búsqueda de "Java" , si estás buscando información sobre una isla del Pacífico, un famoso café, o un lenguaje de programación? Los motores de búsqueda no diferencian, use otra palabra clave para sustituir aquella ambigua o complemente el término.

Busqueda con Protocolo Z39.50

En esencia el Z39.50 permite que un ordenador cliente sea capaz de buscar información en un ordenador servidor y recuperar el resultado de esa búsqueda, a través de especificaciones o reglas de intercambio. Al resolver el problema de la comunicación entre dos sistemas con hardware y software diferentes, se abre la posibilidad de consultar cualquier recurso local o remoto de información bibliográfica, textual o de otro tipo, sin necesidad de conocer cientos de interfaces de usuarios ni la estructura de decenas de bases de datos. La función esencial de cualquier cliente Z39.50 es permitir al usuario realizar búsquedas en bases de datos que cuenten con un servidor Z39.50. El proceso de búsqueda en una sesión Z39.50 consta de las siguientes partes:

1. El usuario del OPAC selecciona una biblioteca objeto. 2. El usuario introduce en el OPAC los términos de búsqueda. 3. La parte del software del OPAC donde trabaja el estándar envía los términos de búsqueda traducidos a lenguaje Z y contacta con el Servidor Z que contiene los recursos de información requeridos.

4. Cuando los dos ordenadores se contactan, se inicia un período de negociación entre ambos, en el que se establecen las reglas de asociación entre los dos sistemas.

5. El Servidor Z traduce el lenguaje Z recibido a una solicitud de búsqueda y responde con los resultados de la búsqueda. 6. El Cliente Z recibe los registros. 7. Finalmente, el resultado aparece en el OPAC del usuario como si se tratara de un registro del propio OPAC.

Servicios del Protocolo Z39.50

Al realizar una búsqueda con Z39.50 existen servicios mínimos que el cliente Z debe contemplar, servicios que se agrupan en lo que el estándar denomina "facilidades":

• Inicialización: configuración de las reglas de comunicación, negociación de los niveles del servicio.

• Búsqueda: envío de una cadena de búsqueda a una base de datos y recuperación de un juego de resultados, y los primeros registros.

- Búsqueda booleana compleja. - Elementos de comparación por fechas. - Operadores de proximidad. - Truncamiento. - Búsquedas completas.

• Recuperación: recuperación de registros tal y como se especificó en el Cliente Z.

• Borrar juego de resultados: permite a un cliente solicitar que se borre un conjunto de resultados determinado, o todos ellos.

• Control de acceso: proceso de verificación por parte del Servidor Z, pedir passwords, etc. • Control de cuentas: gestión de cuentas, crédito, etc.

• Ordenar: permite que el cliente solicite al servidor una ordenación del conjunto de resultados, o unir varios conjuntos y luego ordenar el resultado.

• Visualizar índices: escaneo e índice en el Servidor Z.

• Servicios extendidos: permite al Cliente Z comenzar un paquete de tareas: - Guardar juegos de resultados para uso posterior. - Guardar estrategias de búsquedas. - Definir calendarios periódicos de búsquedas. - Solicitar ejemplares. - Actualizar bases de datos. - Crear especificaciones de exportación.

• Información sobre el servidor: ofrece detalles del servidor como bases de datos disponibles, índices, servicios disponibles.... con idea de que se puedan desarrollar clientes que se auto configuren en función de los servidores que encuentren.

• Terminación: concluye la negociación y la conexión.

GUAJARDO Salinas, Aldo. Z39.50 y OAI-PMH: Protocolos de Transferencia y Recuperación de Información. 2010. p.3. Disponible en: http://www.bibliotecarios.cl/descargas/2010/11/guajardo_z3950.pdf

lunes, 11 de abril de 2011

Búsqueda y Recuperación de Información - Protocolos de Transferencia

Los Sistemas de Información Documental (SID)


Corresponden a un tipo especial de sistema de información cuyo propósito principal es generar información útil a una necesidad específica de información suministrada por un usuario, con el fin de producir nuevo conocimiento.


La información generada por el sistema de información documental se representa mediante documentos que son manejados por el sistema como objetos de información digital (por ejemplo, en los Sistemas Integrados de Gestión de Bibliotecas (SIGB) y en las actuales bibliotecas digitales).


Son numerosos los protocolos desarrollados a través de los años con el fin de permitir la interoperabilidad entre Sistemas de Información Documental (SID):

• Z39.50 • Simple Digital Library Interoperability Protocol (SDLIP) • OAI (Open Archives Protocol) • Guildford protocol • Dienst protocol • ZING SRU/W • Starts (Stanford Protocol Proposal for Internet Retrieval and Search) • Dienst protocol • Lyceum Protocol • Harvest: A Distributed Search System

Sin embargo, sólo algunos de éstos se han consolidado internacionalmente como estándares aceptados por los profesionales de la información, son usados de manera masiva y su desarrollo y mantención se encuentra avalado por iniciativas tanto públicas como privadas: el Protocolo Z39.50 y el Protocolo OAI-PMH.


Protocolo Z39.50

El Z39.50 (Information Retrieval (Z39.50); Application Service Definition and Protocol Specification. ANSI/NISO Z39.50-2003) es un protocolo para la recuperación de información basado en la estructura cliente/servidor que facilita la interconexión de sistemas informáticos y que podría considerarse como la norma más relevante para el mundo de las bibliotecas y de la documentación desde la aparición del formato MARC.


Lo que hace el protocolo Z39.50 es especificar un conjunto de reglas para gestionar las formas y procedimientos de interconexión remota de computadoras, con el propósito de buscar y recuperar información, aunque su aplicación actual es más amplia pues incluye la consulta y el intercambio de datos bibliográficos, y la intercomunicación de índices y resúmenes, de información geoespacial, de documentos oficiales, de objetos digitales o de metadatos que describen los documentos de las bibliotecas electrónicas o digitales.


La estructura del Z39.50 utiliza:

• Un cliente u origin también conocido como Cliente Z, el que se comunica con procesos auxiliares que se encargan de establecer conexión con el servidor, enviar el pedido, recibir la respuesta, manejar las fallas y realizar actividades de sincronización y seguridad. El usuario interactúa con el cliente de forma gráfica.


• Un servidor o target conocido como Servidor Z, el que proporciona un servicio al cliente y entrega los resultados de una tarea específica, estableciendo procesos auxiliares que se encargan de recibir las solicitudes del cliente, verificar la protección, activar un proceso servidor para satisfacer el pedido, recibir su respuesta y enviarla al cliente.

• Una estructura de datos. • Reglas de intercambio. • Un transporte de información confiable como son TCP/IP (Transmission Control Protocol/Internet Protocol) y OSI (Open System Interconnection).

GUAJARDO Salinas, Aldo. Z39.50 y OAI-PMH: Protocolos de Transferencia y Recuperación de Información. 2010. p.1,2. Disponible en: http://www.bibliotecarios.cl/descargas/2010/11/guajardo_z3950.pdf

búsqueda y recuperación de información - Infranet

La Infranet o Internet invisible La infranet o Internet invisible es el conjunto de recursos accesibles únicamente a través de algún tipo de pasarela o formulario web y que, por tanto, no pueden ser indizados de forma estructural por los robots de los motores de búsqueda. Muchos de estos recursos son de gran calidad y, desde el punto de vista del gestor de información, tienen una importancia clave en la recuperación de información de alto valor añadido. Su invisibilidad para los motores de búsqueda implica una dificultad considerable para la recuperación efectiva de estos recursos y requiere aproximaciones novedosas por parte de los profesionales.

1.3.1. Los recursos de la Internet invisible

La propia heterogeneidad formal de la información en Internet puede plantear dificultades a la hora de entender qué recursos están incluido bajo la denominación de Internet Invisible. Con el fin de clarificar qué contenidos pueden resultar invisibles, se ha considerado una clasificación que atiende a criterios documentales. Bases de datos bibliográficas: se incluyen en este grupo los catálogos de biblioteca accesibles a través de una pasarela (OPAC) web, otras bases de datos de referencias bibliográficas (de acceso público o restringido –registro previo gratuito o de pago-) y entidades similares tales como los catálogos de librerías (ej.: Amazon.com) Bases de datos alfanuméricas: definidas por exclusión del grupo anterior, son todas las bases de datos que no tienen carácter bibliográfico. Comprendería, además, los recursos llamados de referencia que requiren algún tipo de pasarela de acceso para su consulta (ej.: Encyclopaedia Britannica). Una situación ligeramente distinta es la planteada por las páginas generadas dinámicamente (asp, jsp, php o similares). Dichas páginas sólo existen en virtud de una consulta puntual, imposible de realizar por los robots de los motores de búsqueda y cuyo contenido puede alcanzar un considerable grado de personalización. Desde un punto de vista documental, los contenidos que explotan están en una base de datos y, por tanto, se consideran dentro de esta categoría. Archivos y revistas electrónicas: se trata de bases de datos que incluyen documentos a texto completo y que sólo se pueden recuperar previa identificación de la referencia, labor para la que se requiere utilizar una pasarela web simple (formulario de consulta) o doble (palabra de acceso y formulario de consulta). Ficheros no HTML o textuales: el (relativo) fracaso de HTML original a la hora de generar páginas con una maquetación muy rica, ha permitido que algunos formatos de diseño más elaborado hayan adquirido popularidad en la web (pdf, ps, ppt, doc). Estos formatos no textuales no son indizados correctamente por los robots de los motores de búsqueda (excepción: Google.com ya indiza documentos pdf y los convierte en HTML) y, por tanto, constituyen una parte del webespacio invisible que ha ido adquiriendo cada vez más importancia.

1.3.2. La recuperación de la información en la Internet invisible

La recuperación de la información en la Internet invisible se apoya fundamentalmente en la disponibilidad de directorios e índices que identifiquen y organicen su principales recursos. El más importante en el mercado español es la sede española de Internet Invisible http://www.internetinvisible.com Las herramientas más importantes para la recuperación de estos recursos de información invisibles son:

Clientes Z39.50: La progresiva adopción del protocolo Z39.50 por la mayoría de las bibliotecas está incrementando el valor de los clientes Z39.50, que ya pueden acceder a una masa crítica de recursos. Bookwhere 2000 Sea Change (www.bookwhere.com) EzCat BookSystems (www.booksys.com/ezcat) ZNavigator EnWare (www.enware.es) ZSearch Infoworks Technology (www.itcompany.com) ZPista Ifgenia Plus (www.ifigenia.es/zeta)

Agentes inteligentes: estos programas se han convertido en herramientas muy populares en Internet, que permiten superar algunos de los problemas tradicionalmente asociados a los motores de búsqueda. No todos los agentes ofrecen acceso a recursos de la Internet invisible e incluso aquellos que así lo hacen lo presentan como opciones avanzadas, normalmente no disponibles en las versiones “shareware”. BullsEye Intelliseek (www.intelliseek.com) Copernic Copernic (www.copernic.com) EZSearch American Systems (www.americansys.com) LexiBot BrightPlanet (www.lexibot.com) WebSeeker Blue Squirrel (www.bluesquirrel.com)


LARA Navarra, Pablo, MARTINEZ Usero, José Ángel. Agentes inteligentes en la búsqueda y recuperación de información. 2004. p.16. Disponible en: http://eprints.rclis.org/bitstream/10760/7941/1/2004-Lib-Agentes.pdf

viernes, 8 de abril de 2011

Búsqueda y Recuperación de Información http://informationrecuperation.blogspot.com

1. Los motores de búsqueda y la recuperación de la información
La recuperación de la información (RI) es una operación en la que se interpreta una necesidad de información de un usuario y se seleccionan los documentos más relevantes capaces de solucionarla. En el contexto de Internet, se puede definir el objetivo de la recuperación como la identificación de una o más referencias de páginas web que resulten relevantes para satisfacer una necesidad de información.

1.1. El lenguaje de interrogación Un lenguaje de interrogación es el conjunto de opciones (órdenes, operadores y estructuras) que, organizados según normas lógicas, permiten la consulta de los recursos de información mediante una expresión, llamada ecuación de búsqueda.



  • Las órdenes son aquellas palabras o abreviaturas que indican al sistema las acciones a ejecutar (buscara la expresión, mostrar los registros resultantes de una búsqueda, ejecutar un perfil de usuario...)


  • Los operadores son los encargados de expresar las relaciones que mantienen entre sí los términos que pueden definir las necesidades informativas del usuario. Si bien inicialmente las ecuaciones de búsqueda se formulaban mediante la formulación textual de expresiones, la implantación de interfaces gráficas a partir de los años 80 llevó al uso de nuevos entornos de selección, donde el usuario sólo debe introducir los términos y guiarse por un sistema de botones y menús desplegables.

1.1.1. Operadores lógicos o booleanos Llamados así en honor a George Boole, matemático del siglo XIX que fue el precursor de la lógica simbólica y el álgebra de Boole (teoría de conjuntos), es uno de los métodos más extendidos de especificar las búsquedas en la mayoría de sistemas. Se basan en tres operaciones lógicas básicas:




  • Intersección de conjuntos :AND/ Y Operador que indica que deben estar incluidos en los resultados de la búsqueda los términos unidos por esta partícula. Es un operador restrictivo, puesto que elimina aquellos documentos en los que no aparecen todos los términos de la expresión de búsqueda. Ejemplo: bullseye AND copernic, indica que deben aparecer en el documento las dos palabras si no es así se excluirá el documento.


  • Unión o suma de conjuntos : OR / O Indica que cualquiera de las palabras que estén unidos por este operador debe aparecer en el documento, las restantes no tienen que estar presentes. Es un operador de ampliación, pues sólo deberá aparecer uno o alguno de los términos de la expresión de búsqueda. Ejemplo: bullseye OR copernic, puede aparecer en el documento la palabra bullseye o copernic o ambas


  • Exclusión de conjuntos: NO/ AND NOT Operador que excluye de un documento la palabra no deseada. Es un operador de restricción, pues se seleccionan aquellos documentos que contienen el primer término de búsqueda, pero no el segundo. Ejemplo: Knowbots AND NOT copernic, recupera todos los documentos que contengan la palabra Knowbots pero que no contengan la palabra copernic. En la elaboración de una ecuación de búsqueda es habitual la combinación de más de uno de estos operadores, por lo que será necesario conocer en profundidad el sistema para saber las prioridades a la hora de su ejecución, puesto que los resultados pueden variar sustancialmente. A menudo, estas prioridades vienen marcadas por el uso de paréntesis, de manera que se ejecuta en primer lugar el operador que une los términos que están entre paréntesis. Ejemplo: (bullseye OR copernic OR lexibot) AND (agentes inteligentes), recupera los documentos que contengan los terminos agentes inteligentes y copernic o bullseye o lexibot.

1.1.2. Operadores posicionales Los operadores posicionales toman como partida la posición del término en relación a su contexto, es decir, en relación a los otros términos y al documento. Estos operadores se pueden dividir en dos tipos: los relativos y los absolutos.


1.1.2.1. Operadores posicionales relativos A menudo llamados operadores de adyacencia o proximidad. Permiten definir al sistema de búsqueda la distancia que puede existir entre un término y otro. Se pueden buscar términos que estén juntas, separadas por varias palabras o caracteres, que se encuentren en una misma frase o un mismo párrafo, e incluso si se debe o no respetar el orden de los términos. Existe una gran variedad de operadores de adyacencia, y expresan diferentes situaciones según los sistemas.




  • NEAR, operador que obliga a estar a un número determinado de distancia las palabras claves a recuperar. Este número varía en función de los diferentes programas de recuperación de la información: así, por ejemplo, mientras en Altavista significa un máximo de 10 palabras entre los términos, en WebCrawler significa un máximo de 2 palabras. Ejemplo: bullseye NEAR copernic recupera textos con frases como “bullseye es mejor que copernic” o “copernic tiene más motores que bullseye”


  • NEAR/N, realiza la misma operación que NEAR, pero N es sustituido por la distancia en palabras que deben estar separados los términos de búsqueda. Ejemplo: bullseye NEAR/5 copernic, recupera todos los documentos que aparezcan los dos terminos y cuya separación no sea mayor a cinco palabras.

LARA Navarra, Pablo, MARTINEZ Usero, José Ángel. Agentes inteligentes en la búsqueda y recuperación de información. 2004. p.6-7. Disponible en: http://eprints.rclis.org/bitstream/10760/7941/1/2004-Lib-Agentes.pdf

Proceso de elaboracion de un buscador

El tema de la clase de recuperacion de informacion estuvo basada en como se debe realizar un buen buscador eficiente que consolide fuentes de informacion relevantes sobre bibliotecas, archivos, centros de informacion por paises, y de esta manera evidenciar las riquezas de los contenidos ( libros, revistas, tesis, OVAS ). Un primer paso es revisar todos los repositorios y directorios de cada pais. Sobre las URL recopiladas se debe acceder a google y buscar en cada recurso cuales son los teminos que mas se utilizan para recuperar información Luego se puede realizar la busqueda en google agregando las palabras relevantes con operadores OR que significa encuentre esto o esto, tambien el operador AND que significa encuentre esto y esto osea une; existen muchos operadores que limitan o amplian las busquedas segun se requiera. Esta informacion nos permitirá descubrir las formas mas eficientes de recuperar informacion y debe depositarse en una plantilla. Por el momento les dejamos estos tips que iremos complementando en la medida que avancemos. ¡Esten pendientes!

lunes, 4 de abril de 2011

Que es meta-biblioteca

Metabiblioteca es un portal desarrollado alrededor de una comunidad de personas e instituciones en las cual se incluyen estudiantes, profesionales y expertos del área de los sistemas de información, bibliotecología y archivística, lo ideal es proponer nuevos proyectos para construir productos y servicios de información para bibliotecas y archivos.

Una primera iniciativa es realizar buscadores por países que sean eficientes en la recuperación de información y lo haremos en la clase de recuperación de información.

¡esperen nuestros resultados!


jueves, 31 de marzo de 2011

SISTEMAS DE RECUPERACIÓN DE INFORMACIÓN

La recuperación de información nace de la necesidad de resolver un problema, anteriormente cuando no habia maquinas y los procesos eran manuales en las bibliotecas se usaban ficheros e indices pero con el paso del tiempo y la evolución de las tecnologias, los volumenes de información aumentarón y se hizo necesaria la utilización de maquinas que permitan realizar el proceso de buscar, indizar, determinar relevancias, preguntas etc., de alli la creación de los Sistemas de Recuperación de Información (SRI).


Entonces recuperación de información a las luz de los SRI son todos los procesos automatizados que permiten solucionar una necesidad de información, en donde el usuario accede a documentos relevantes y le entrega resultados mas alla del termino exacto introducido en la búsqueda.


De esta manera un SRI recupera documentos Relevantes es decir, que son importantes dentro de un tema, aunque el estado ideal sería que el sistema entregara documentos pertinentes por los volumenes de información no es tan sencillo de hacer.

martes, 29 de marzo de 2011

¿Se puede recuperar los metadatos de las imágenes?


esto se puede lograr con las tic´s y la visión que como profesionales de información debemos tener en la búsqueda y recuperación de información, les compartimos un ejemplo aplicado.

¿Quiero saber cómo hago para buscar en algún sitio de Internet y saber a qué lugar corresponde esta fotografía?

Realice la búsqueda en google por programas que reconozcan imágenes en la Web y me arrojo entre las primeras TinEye http://www.tineye.com/ “reverse imagen search” tiene dos opciones subir la imagen, si es así se puede utilizar picture manager de office o ingresar la URL y el busca las páginas de origen. 

Se sube la imagen e inicia el reconocimiento como resultado entrega las paginas similares o de origen, que es la página inmagine www.inmagine.com allí aparecen las imágenes más parecidas hasta que localizamos la que necesitamos, todas tienen un recuadro que tiene los datos descriptivos como el lugar, la cantidad de imágenes relacionadas con el país o región, el costo y una numeración acompañado de las siglas ICN. Se elige la imagen ICN169052 y ahí ya muestra la foto y en la parte inferior dice “Reunión, woody mountains inside the island, aerial view” http://www.inmagine.com/icn169/icn169052-photo además si uno desea adquirir la foto puede solicitarla en varios tamaños y de allí una variable en el costo, de ahí realice la búsqueda en google y aparecen 135.000 resultados en el primer resultado esta fotosearch y http://www.fotosearch.com/ICN291/f0027155/
 
Entre otros resultados que arrojan la imagen asociada al titulo.