lunes, 19 de octubre de 2015

Aprendiendo informática: Formatear

Anteayer una amiga me hacia una consulta y me ha inspirado para hacer el post de hoy. Al parecer, llevó un pendrive con datos a imprimir a una tienda y cuando se lo devolvieron habia una carpeta con el nombre "cuarentena" en su interior. Esto la hizo sospechar que pudiera tener un virus, asi que me pidio ayuda para desinfectarlo. Yo le contesté que la mejor manera era formatearlo y como ella tiene un Mac, tuvimos que consultar la forma de hacerlo en su sistema. Poco después me preguntó extrañada, ¿es normal que ponga que le faltan 40 minutos? Por lo visto, los Mac incluyen por defecto un sistema de borrado seguro en la opcion de formateo y ella había marcado la opción 3 de 4 dentro de los niveles de seguridad. A todo esto, recordé que mucha gente no sabe lo que es el formateo realmente, asi que os lo voy a explicar hoy.

Como siempre, la explicación pretende ser comprensible y no exacta, asi que si quereis informacion detallada y completamente correcta no la encontrareis aqui.

Seguramente hayais oido esa palabra, formatear, y la hayais asociado a "borrar el disco". En realidad no es lo mismo, sino que el formateo tiene como consecuencia el borrado del acceso a los archivos.

En principio, un disco duro, una cinta magnetica o un disquete son solo una superficie recubierta de particulas magneticas que se pueden recolocar. No se guardan los archivos tal cual, sino que hay una estructura de datos que hay que respetar, y a esta se le denomina "formato".

La forma mas simple que podemos pensar ahora mismo es un formato de tabla de localización de archivos. Este sistema se basa en grabar lo siguiente en el disco, empezando desde un punto predeterminado (el que llamaremos "sector de inicio"):

1. Cierta información sobre el tamaño del disco y sobre el formato que se usará.
2. Una tabla que asocia el nombre de un archivo con su posición en el disco.
3. La parte del disco que almacena los datos.

Cuando se quiere acceder al contenido de un archivo, se comprueba en esa tabla en que posición está ese archivo y se lee. Hasta aqui bien, pero ¿quien se encarga de "inicializar" ese disco? A esa operación se le llama "formatear". Es, en definitiva, crear esa tabla y dejarla en blanco. Es imprescindible realizar esa operación al usar un nuevo disco, aunque los discos externos vienen siempre formateados, los disquetes tambien, los pendrives mas de lo mismo y los programas que particionan los discos duros (otro concepto interesante) los suelen formatear al crear las particiones.

Como es lógico, al dejar esa tabla en blanco, el disco duro está aparentemente en blanco y puede ser escrito, aunque en la parte que almacena los datos haya información.

Ese formateo puede realizarse de dos modos, el modo "rápido" y el modo "normal". En el modo normal, se examina el disco para buscar si hay alguna parte dañada, luego se escribe la tabla y se marcan las partes dañadas como "inutilizables". En el modo "rapido", se escribe la tabla como si el disco no tuviera partes dañadas. Si en algun momento el disco detecta un error, se marcará en la tabla de todos modos. En realidad, el modo normal da una mejor información sobre el tamaño utilizable del disco y en caso de que tenga una gran parte dañada acelera la escritura (ya que se sabe donde están los daños exactamente.

¿Y que hay de los modos adicionales?

Como ya habiamos comentado, el formato no elimina los datos del disco, solo la tabla. Eso permitiria a alguien con las herramientas necesarias (desde programas especificos a microscopios electronicos) recuperar los datos que habian sido grabados. La solución: borrar también esos datos grabados escribiendo otra cosa encima.

El sistema mas simple, escribir "ceros" en toda la superficie. No es infalible, pero si requiere mas tiempo y unas herramientas mas potentes para recuperar esos datos (la grabación magnetica no es tan simple como unos y ceros). Esta operación se puede realizar escribiendo primero ceros, luego unos, luego ceros de nuevo, y asi en repetidas ocasiones. Cuantas mas "pasadas" se realicen, mas dificil será recuperar esos datos.

Otro sistema, mas seguro es escribir datos aleatorios en cada pasada. En el caso de que se intenten recuperar datos solo se recuperarán datos inservibles. Tras varias pasadas es mucho mas dificil reconocer datos "legitimos" de datos "basura".

Bueno, esto es el formateo. Volvemos con mi amiga. ¿Que clase de formateo necesitaba realizar para eliminar su virus? Cualquier clase de formateo le habría valido. No se trata de un pendrive dañado, con lo que un formateo rápido debería bastar. Tampoco se trata de eliminar datos por seguridad, así que los formateos "seguros" no son necesarios. La unica consecuencia que ha tenido es que ha tardado cuarenta minutos en realizar una operación que podía haber realizado en dos minutos (máximo).

Sabiendo esto, ya no cometereis el mismo error de confundir formatear (inicializar) un disco con borrarlo.

Un saludo.

domingo, 11 de octubre de 2015

Publicacion de mis subtítulos en otras páginas (IV)

Por fin tengo algún tipo de "respuesta". El administrador de la pagina ha hecho ademán de comunicarse conmigo mediante facebook.

Me han llegado unos mensajes que paso a citar (en gris):

- hola amigo

- que tal

- soy el dueño

- xk no te unes

Y mis respuestas (en verde):

- hola

- ¿a que te refieres con que me una?


(10 minutos en blanco, esperando respuesta)

- ¿a que te refieres con que me una? ¿a la pagina de facebook?


No me quedan claras sus intenciones, si quiere que me una a su grupo de facebook, como colaborador de su página o que es lo que me sugiere. En cualquier caso, mis intenciones iniciales son las mismas: que retire mi material actual y futuro de su página, puesto que me puede acarrear problemas legales.

Mas información, cuando la haya.

Un saludo.

sábado, 10 de octubre de 2015

Nuevo seguidor

En mi panel de control del blog me acaba de aparecer que tengo un segundo seguidor. Quería darle desde aquí la bienvenida.

Un saludo, y espero que te diviertas y aprendas mucho.

Publicación de mis subtítulos en otras páginas (III)

Ha pasado ya una semana desde que me puse en contacto con e..z solicitando la retirada de mis subtítulos de d..s y no he obtenido respuesta ni he visto que haya tomado ninguna acción. Por eso mismo, he enviado un mensaje al administrador de d..s mediante facebook con el siguiente texto:

Hola

Soy el traductor de la version de Legal high 2 que hay subida a d..s.

Por lo visto el uploader, e..z, ha subido una versión en hardsub de mis subtítulos a pesar de que indico expresamente que no autorizo a que se publiquen fuera de mi blog y menos aun en formato hardsub.

Por esta razón, quería pediros que retirarais esa versión de vuestra página.

Un saludo

I..z (acerswap)

Por el momento voy a seguir manteniendo en privado la identidad de la página y del uploader. Dependiendo de lo que ocurra en los próximos siete días decidiré si hago publico el nombre de la página y del uploader.

Un saludo, y ya sabeis que os mantendré informados.

sábado, 3 de octubre de 2015

Publicación de mis subtítulos en otras páginas (II)

Hoy haciendo un barrido en Google para ver si mis subtítulos se han distribuido sin control me he llevado la desagradable sorpresa de ver una copia en hardsub de Legal high 2 en una página de streaming (a la que me referire como "d..s"). Como ya sabeis, en todas mis traducciones indico que no quiero que se distribuyan en forma de hardsub.

He decidido solicitar, por las buenas, la retirada de esos subtítulos. He localizado a través de la página al uploader (al que me referire como "e..z") y afortunadamente le he encontrado a través de un foro con el que ya tuve problemas (al que me referiré como "l..b").

Le he escrito un mensaje privado, que paso a citar:

Buenos dias, e..z

Soy acerswap, traductor de la serie Legal high 2 al castellano. Acabo de ver que has subido una versión hardsub de mis subtítulos a d..s. Tengo que pedirte que retires esa subida de la página y de todas en las que lo hayas subido. Que mi nick aparezca en un hardsub me puede traer problemas legales, aparte de que lo solicité expresamente en los términos de distribución.

También te pido que si sabes de alguna otra página que contenga esa versión, me lo indiques para que pueda solicitar su retirada al uploader o a la página correspondiente.

Un saludo.

En un par de dias, mirare si ha sido retirado el video o si recibo algún mensaje a través de l..b. Os mantendré informados.

Un saludo

viernes, 2 de octubre de 2015

Aprendiendo informática: OCR - Resultados AviSubDetector

Ya que ayer vimos como se usa AviSubDetector, vamos a comprobar los resultados que nos han salido al usar nuestro juego de pruebas.

Para ello, realice las pruebas hace un par de dias, antes de la escritura del tutorial, con las mismas opciones que mostré.

Si hay algo que se observa de manera mas que evidente en cuanto abres el archivo es la precisión a la hora de calcular la temporizacion. La tasa de error es como mucho de 4 centesimas de segundo.

Otra cosa que se percibe es que aunque existen lineas que se salta, cosa que también sucede con SubRip. A cambio, existen lineas que duplica, posiblemente en cambios de escena, pero están correctamente sincronizadas para que no haya saltos.

Se da tambien el problema de las comillas y el apostrofe, pero es común a ambos programas. Este tampoco cae en ninguna de las trampas, lo que me hace pensar que han sido demasiado sencillas. Lamentablemente, la linea con la cursiva se la saltó entera, así que no pude probarlo. Para el próximo juego de pruebas pondré una o dos lineas completas.

El tiempo que se tarda es bastante menor, cerca de unos cinco-ocho minutos, y la precisión es buena. En SubRip existen frases ininteligibles, mientras que aquí el fallo es menos acusado.

En cualquier caso, ya sabeis que me gusta dejaros las pruebas para que las realiceis si quereis en casa.

En este enlace están los resultados de la prueba sin modificar: https://app.box.com/s/oaj8jhg7q777jnv47crg90xwh6d89m4g

En este otro, la comparativa entre la versión original (en la parte superior) y la transcripción: https://app.box.com/s/o9br2fal0rynqztsnwh8pgnte1yu0qux

Con esto, en principio, finaliza el proyecto OCR (aunque no descarto añadir algo mas adelante). Un saludo y no olvideis pasar por aqui cada cierto tiempo para ver si he comenzado con alguna nueva traducción o algun tutorial.

jueves, 1 de octubre de 2015

Aprendiendo informática: OCR - Introducción a AviSubDetector

Hoy voy a mostraros el funcionamiento de AviSubDetector. Es un programa infinitamente mas complejo que SubRip, e inicialmente fue ideado para detectar en que frames hay un subtitulo, su posición y el instante de tiempo en que aparece. La opción de OCR aún es experimental, aunque funciona realmente bien. No conozco apenas el programa, pero os puedo mostrar los elementos básicos.



En la ventana que sale nada mas abrir el programa observamos la opcion OCR en la parte superior, una barra de desplazamiento. Todas las opciones están dentro de las pestañas inferiores, no en los menús, así que vamos a examinarlas.


Como en el otro programa, existe la posibilidad de recortar la imagen para seleccionar la zona que contiene los subtítulos. Existe la posibilidad de seleccionarlo como 1/2, 1/3, 1/4 o 1/5 de la pantalla o hacerlo a mano. En mi caso he seleccionado en la sección "Crop" (recortar) los porcentajes Top (87%) y Bottom (1%) para encuadrarlo.



La siguiente parte que veremos está en la pestaña OCR (que también tiene mas pestañas dentro). En la sección Auto-search podemos seleccionar si la conocemos la fuente (el tipo de letra) en que están nuestros subtítulos. También seleccionaremos las letras que queremos que busque por defecto, si queremos buscar letras en cursiva y algo que parece una tontería, pero que en realidad no lo es: el orden de la búsqueda. El programa inicialmente compara la letra que lee con las que conoce. Una vez coincide, la escribe y pasa a la siguiente. En ese caso, si aparece en la lista que debe buscar primero la letra u y luego la ú, detectará la letra u e ignorará el acento. Podemos quitar y añadir letras si queremos.

Inicialmente esto no es necesario, ya que si no encuentra la letra lo que hará es pedirnos que la introduzcamos a mano, pero es una forma de facilitarle el trabajo. La velocidad y la precisión aumentan de una manera sorprendente, asi que nos conviene seleccionar una fuente y si no conocemos cual es al menos una similar.

Presionamos el botón de Start (Full) y nos encontramos con esta nueva ventana:


En la parte superior vemos la linea que está analizando, con un recuadro blanco los subpictures y recuadrado en negro el subpicture que se está comprobando. Encontramos tres imagenes debajo. La izquierda se corresponde con la nueva letra que introducirá en la matriz de simbolos. En la parte central, el símbolo que ha encontrado mas parecido, y a la derecha una superposición entre ambos, para mostrar por que los ha encontrado parecidos. Debajo de las imagenes hay una casilla en la que introducir el caracter correspondiente, si está en cursiva, negrita o subrayado. Los botones inferiores nos permiten (en este orden) agregarlo a la matriz de simbolos, escribirlo a mano sin agregarlo a la matriz, eliminar el símbolo existente por ser erroneo o ignorar lo que ha encontrado por ser un falso positivo.

En cuanto al botón siguiente, "Use full rect" es algo que le falta a SubRip. Observad la siguiente imagen:


Si os fijais, ha detectado la mitad de la i, dejando el punto fuera. En cambio ha detectado un posible subpicture que lo incluye. Es posible indicar que debe analizar el subpicture exterior, incluyendo el palito y el punto de la i. Presionamos el boton y como veis se selecciona la i por completo. Es posible que nos vuelva a pedir confirmación, pero no es necesario cambiar nada mas.


Como veremos en la siguiente captura, se ha ido creando la matriz de simbolos (como las capturas las he realizado al poco de empezar, aparece casi vacía. Esta en la pestaña "Symbols". NOTA: no siempre permite cambiar la pestaña una vez comenzada la transcripción, con lo que es recomendable que si quereis ver la matriz entreis en la pestaña antes de iniciar la transcripción.


En la parte inferior, junto a la barra de progreso de la linea vemos como va reconociendo los caracteres en tiempo real. En caso de que no reconozca un caracter, lo sustituirá por #. En el caso de saltos de línea, por |.

Ocurrirá también que examinará varias veces algunas lineas, sobre todo si aparecen en un cambio de escena. Si detecta erroneamente la linea, creará una linea duplicada.

Ahora quiero mostrar un par de casos especiales:


Este primer caso muestra dos elementos, el primero es una detección erronea en el acento. A veces sucede que detecte el acento como una coma, pero si aparece dentro de un subpicture "ampliable" no hay problemas. En la misma captura podemos ver que hay veces que detecta subpictures con dos letras, el "fo" que se muestra es un ejemplo.Tambien se pueden introducir varias letras.

El último caso es el de los "positivos fantasma". Mirad esta captura:


El subpicture activo que se muestra es un palito en la parte superior izquierda. Ahi no hay ningun caracter. No os despisteis, aunque haya una i en la linea debeis decirle que ignore ese caracter.

Al terminar e ir a cerrar el programa os dara la opcion de salvar el subtitulo. Podeis salvar también la matriz de símbolos, per no es necesario.

En principio eso es todo. Ya sabeis lo suficiente para hacer vuestras pruebas. Mañana analizaré los resultados y quizás haga una comparativa.

Un saludo.