Mostrando entradas con la etiqueta Mantenimiento de sistemas. Mostrar todas las entradas
Mostrando entradas con la etiqueta Mantenimiento de sistemas. Mostrar todas las entradas

miércoles, 27 de octubre de 2010

Subir a 6Mb (interludio)

Por alguna razón (que aún no comprendo del todo) mi nuevo servidor se caía repetidamente. Puede ser culpa (en parte) del hardware: viejo y lleno de polvo; puede ser también culpa de la línea ADSL de allí, cerca del límite de distancia; puede ser también cosa del enrutador ADSL, que es verdaderamente viejo (con decir que no tiene interfaz web sino tan solo telnet); puede que sea culpa de la instalación de cobre de la casa (oxidada en sitios, húmeda en otros, y mal mantenida); o puede, en fin, que sea cosa de todo lo anterior junto.

Pero sí ocurría que a veces el ordenador en cuestión (el factor 1, el «jargüar») se quedaba bloqueado (cosa que empezó a hacer allí). Quizá el viaje le echó un meneo al polvo, quiero decir, el viaje meneó el polvo.

Así que cogí un microportátil con una Debian recientita (una testing de hace un mes), le instalé el Bind, Postfix y el Courier, copié las configuraciones del polvoriento, y a correr.

De momento, funciona.

Seguiremos informando.

viernes, 10 de septiembre de 2010

El botón de apagado

Ya he comentado alguna vez que no me gusta el polvo. El polvo en los ordenadores, se entiende. Y hoy, por tercera o cuarta vez, pasando una brocha (una simple brocha) por mi ordenador nuevo para quitarle el polvo ambiente, se apagó. Eso es lo que se llama tener un botón de encendido muy sensible, tanto que ahora lo llamo «botón de apagado».

Así que ni corto ni perezoso, y sabiendo que voy a seguir pasando la brocha o incluso un paño para limpiar el polvo externo de vez en cuando, me he metido en la carcasa y he tirado de los cables blanco y rojo, para desconectar de la placa base el susodicho interruptor.

martes, 3 de marzo de 2009

Estas cosas pasan

Lo mejor de tener un disco de copias de seguridad es que, si se te muere el disco duro, no pierdes la información.

Esto es cierto incluso si se muere el disco de las copias de seguridad, que es lo que me acaba de pasar. Hace un par de semanas vi que uno de mis discos externos de LaCie no funcionaba. Precisamente el disco de mis copias de seguridad.

Bueno, pues abrí la caja y vi que el disco interno era un Barracuda SATA de Seagate. No es en absoluto lo que entiendo por un mal disco.

Hoy he comprobado, enchufando el disco directamente a otro ordenador con SATA, que lo puedo dar por difunto. Pero en fin, no he perdido nada: todo lo que había eran copias de seguridad, así que lo único que me queda es rezar para que no se me estropee el disco de sistema antes de comprar otro disco externo para volver a empezar a hacer copias.

miércoles, 7 de enero de 2009

Comprar nuevo no es necesario.

El ordenador que estuve limpiando en noviembre venía arrastrando otros fallos, que resultaron ser del procesador. Igual precisamente por exceso de polvo se sobrecalentó en parte.

El caso es que tuve que cambiar el procesador, y ya no es sencillo encontrar procesadores para un zócalo 462 (el «socket A») de AMD.

El problema es que mi placa base es una Asus A7V8X que admite procesadores de hasta 2,4GHz , pero en «la tienda de la esquina» conseguí un Athlon XP 2600+. Y éste tampoco fue bien.

Finalmente, conseguí también un Athlon XP 3000+, que en realidad va a 2,1 GHz (el número del modelo no son los GHz), y poniendo adecuadamente la pasta térmica, he conseguido una máquina que a día de hoy lleva un uptime de 30 días. Nada mal para un procesador de segunda mano en una placa usada 24x7, que es hoy mi servidor de correo y páginas web (y varias cosas más), aparte del ordenador de escritorio de mi esposa.

¿De verdad hace falta comprar un ordenador nuevo completo cada vez que cierta empresa de Redmond saca una nueva versión?

martes, 2 de diciembre de 2008

Inestablemente estable


A veces, en Debian, uno tiene que instalar un paquete de una rama diferente a la que está utilizando. Por ejemplo, uno tiene un servidor instalado con la rama estable y tiene que instalar un determinado paquete de la rama de pruebas o de la inestable porque es la única manera de conseguir determinada característica.

Para entendernos, Debian tiene cuatro ramas: la estable (stable), la de pruebas (testing), la inestable (unstable) y la experimental (experimental). Normalmente el trabajo de desarrollo se hace en la inestable, y los programas que después de diez días en inestable no dan problemas se pasan a la rama de pruebas. Así, si se quiere estar siempre a la última hay que instalar el sistema con la rama inestable, pero es perfectamente posible que el sistema quede inutilizable. La rama de pruebas es la preferida por mucha gente que quiere estar a la última con sus escritorios pero sin arriesgarse a que todo quede parado, mientras que la rama estable es ideal para servidores o para administrar grandes conjuntos de máquinas iguales.

Por su parte, la rama experimental tiene versiones demasiado inestables incluso para la rama inestable. De hecho no es una rama completa, uno no puede instalar un sistema complete utilizando solamente paquetes de esta rama.

Pues bien, se me ha dado el caso de que en un ordenador con la rama de pruebas instalada necesité instalar ImageMagick, pero resulta que la versión de este programa que viene en esta rama (la 6.3.7.9) utiliza como compresor MPEG el programa mpeg_encode, que no existe en Debian. En cambio, la versión de la rama experimental es la 6.4.5.4 que utiliza ffmpeg, que sí está disponible.

La primera opción es bajarse el imagemagick de experimental e instalarlo a mano. Esto se empieza a complicar cuando uno descubre que necesita dos librerías más, también de experimental, y cambiar la versión de otro paquete que también tiene dependencias.

Y claro, uno se pregunta "¿Para qué tengo que hacer todo esto si es justo el tipo de cosas que le encanta a apt?"

La solución:

Lo primero, hay que dejarle bien claro a apt qué rama queremos utilizar normalmente:

#/etc/apt/apt.conf

APT::Default-Release "testing";


Lo segundo, hay que tener las fuentes de la rama que necesitamos, aparte de las fuentes de la rama que tenemos normalmente:

#/etc/apt/sources.list

# Fuentes remotas de paquetes
deb http://ftp.es.debian.org/debian/ stable main contrib non-free
deb http://ftp.es.debian.org/debian/ testing main contrib non-free
deb http://ftp.es.debian.org/debian/ unstable main contrib non-free
deb http://ftp.es.debian.org/debian/ experimental main contrib non-free

# Actualizaciones de seguridad
deb http://security.debian.org/ stable/updates main contrib non-free
deb http://security.debian.org/ testing/updates main contrib non-free


Y listo. Actualizamos las listas de paquetes con aptitude update o apt-get update (o dselect o Synaptic o lo que cada uno prefiera) y ya estamos preparados para indicarle al sistema lo que queremos:

# aptitude install imagemagick/experimental
Leyendo lista de paquetes... Hecho
Creando árbol de dependencias
Leyendo la información de estado... Hecho
Leyendo la información de estado extendido
Inicializando el estado de los paquetes... Hecho
Leyendo las descripciones de las tareas... Hecho
Los siguientes paquetes están ROTOS:
libmagickcore1
Se instalarán los siguiente paquetes NUEVOS:
ghostscript{a} gsfonts{a} imagemagick imagemagick-doc{a} libcupsimage2{a} libgd2-noxpm{a} libgomp1{a} libgraphviz4{a}
libgs8{a} libilmbase6{a} libjasper1{a} libltdl3{a} libmagickwand1{a} libopenexr6{a} libpaper-utils{a} libpaper1{a}
libwmf0.2-7{a} psfontmgr{a}
0 paquetes actualizados, 19 nuevos instalados, 0 para eliminar y 0 sin actualizar.
Necesito descargar 13,7MB de ficheros. Después de desempaquetar se usarán 48,4MB.
No se satisfacen las dependencias de los siguientes paquetes:
libmagickcore1: Depende: libdjvulibre21 (>= 3.5.21) pero no es instalable
Las acciones siguientes resolverán estas dependencias

Instalar los paquetes siguientes:
libdjvulibre-text [3.5.21-1 (unstable)]
libdjvulibre21 [3.5.21-1 (unstable)]

La puntuación es 12

¿Acepta esta solución? [Y/n/q/?]
Se instalarán los siguiente paquetes NUEVOS:
ghostscript{a} gsfonts{a} imagemagick imagemagick-doc{a} libcupsimage2{a} libdjvulibre-text{a} libdjvulibre21{a}
libgd2-noxpm{a} libgomp1{a} libgraphviz4{a} libgs8{a} libilmbase6{a} libjasper1{a} libltdl3{a} libmagickcore1{a}
libmagickwand1{a} libopenexr6{a} libpaper-utils{a} libpaper1{a} libwmf0.2-7{a} psfontmgr{a}
0 paquetes actualizados, 21 nuevos instalados, 0 para eliminar y 0 sin actualizar.
Necesito descargar 14,4MB de ficheros. Después de desempaquetar se usarán 50,5MB.
¿Quiere continuar? [Y/n/?]
Escribiendo información de estado extendido... Hecho
Des:1 http://ftp.fr.debian.org testing/main libcupsimage2 1.3.8-1lenny2 [98,5kB]
Des:2 http://ftp.fr.debian.org testing/main libpaper1 1.1.23+nmu1 [20,6kB]
Des:3 http://ftp.fr.debian.org testing/main libgs8 8.62.dfsg.1-3.1 [2219kB]
Des:4 http://ftp.fr.debian.org testing/main gsfonts 1:8.11+urwcyr1.0.7~pre44-3 [3373kB]
Des:5 http://ftp.fr.debian.org testing/main ghostscript 8.62.dfsg.1-3.1 [766kB]
Des:6 http://ftp.fr.debian.org testing/main libgomp1 4.3.2-1 [13,2kB]
Des:7 http://ftp.fr.debian.org unstable/main libdjvulibre-text 3.5.21-1 [74,4kB]
Des:8 http://ftp.fr.debian.org unstable/main libdjvulibre21 3.5.21-1 [682kB]
Des:9 http://ftp.fr.debian.org testing/main libgd2-noxpm 2.0.36~rc1~dfsg-3 [221kB]
Des:10 http://ftp.fr.debian.org testing/main libltdl3 1.5.26-4 [177kB]
Des:11 http://ftp.fr.debian.org testing/main libgraphviz4 2.20.2-3 [536kB]
Des:12 http://ftp.fr.debian.org testing/main libilmbase6 1.0.1-2+nmu2 [118kB]
Des:13 http://ftp.fr.debian.org testing/main libjasper1 1.900.1-5.1 [145kB]
Des:14 http://ftp.fr.debian.org experimental/main libmagickwand1 7:6.4.5.4.dfsg1-1 [332kB]
Des:15 http://ftp.fr.debian.org testing/main libopenexr6 1.6.1-3 [262kB]
Des:16 http://ftp.fr.debian.org testing/main libwmf0.2-7 0.2.8.4-6 [174kB]
Des:17 http://ftp.fr.debian.org experimental/main libmagickcore1 7:6.4.5.4.dfsg1-1 [1667kB]
Des:18 http://ftp.fr.debian.org experimental/main imagemagick 7:6.4.5.4.dfsg1-1 [86,1kB]
Des:19 http://ftp.fr.debian.org experimental/main imagemagick-doc 7:6.4.5.4.dfsg1-1 [3410kB]
Des:20 http://ftp.fr.debian.org testing/main libpaper-utils 1.1.23+nmu1 [17,6kB]
Des:21 http://ftp.fr.debian.org testing/main psfontmgr 0.11.10-0.2 [22,2kB]
Descargados 14,4MB en 3min47s (63,5kB/s).
Preconfigurando paquetes ...
[...]
Leyendo lista de paquetes... Hecho
Creando árbol de dependencias
Leyendo la información de estado... Hecho
Leyendo la información de estado extendido
Inicializando el estado de los paquetes... Hecho
Escribiendo información de estado extendido... Hecho
Leyendo las descripciones de las tareas... Hecho


Como se puede ver, la barra al final del nombre del paquete indica "quiero este paquete de esta rama", y el sistema ha bajado el paquete de experimental, y sus dependencias, mientras fue posible, de la rama actual, la de pruebas. Además, las actualizaciones del sistema no darán problemas diciendo siempre "hay nuevos paquetes disponibles" cuando esos paquetes no sean de la rama actual.

martes, 11 de noviembre de 2008

¿Cuanto polvo cabe en un ordenador?




La respuesta es: mucho. Sobre todo si no se limpia.

El otro día me decidí a limpiar de polvo un ordenador que tengo en casa. Lleva años funcionando, y hace tiempo que no lo limpiaba. De hecho, había dejado de funcionar: ya sabemos que el polvo es conductor, y además tiene otro problema, y es que bloquea los ventiladores, con lo que las temperaturas suben.

El caso es que lo desmonté pieza a pieza. Se puede ver en la primera foto el estado del disipador del procesador cuando quité su ventilador. Y el ventilador andaba igual, así como el resto de la placa.

La tercera foto muestra todas las piezas y el total de polvo extraído: un montón.

Y eso que al ventilador de carcasa tuve incluso que darle aceite vegetal a ver si volvía a funcionar, porque tenía tanto polvo dentro del mecanismo, entre el rotor y el estator, que andaba a menos de la mitad de su velocidad normal.

Eso sí, una vez limpio y vuelto a montar, la máquina no ha vuelto a dar problemas.

martes, 14 de octubre de 2008

SMART

Este artículo es principalmente una traducción del que me han publicado en Debian Package of the Day y que llegó luego a DebianTimes.




Uno de los paquetes que instalo manualmente en toda nueva instalación es smartmontools. Tengo cierta experiencia administrando ordenadores y redes, y es un hecho que los piratas informáticos y los fallos de los programas (bugs) no son la mayor causa de problemas en instalaciones pequeñas y medianas. Lo es el hardware.


Luego tenemos aparatos que pueden fallar, y Murphy dice que si algo puede fallar, fallará. El asunto no es evitar los fallos físicos, lo que es imposible, sino detectarlos rápidamente o incluso prevenirlos.


Particularmente para los discos duros, la herramienta encargada es smartctl del paquete smartmontools. Los discos IDE (si no son de la era de los dinosaurios) tienen una herramienta integrada de autoanálisis llamada SMART que significa“Self-Monitoring, Analysis and Reporting Technology” (Tecnología de Auto-Monitorización, Análisis e Informe). Los discos SCSI modernos también la tienen si son SCSI 3 o más nuevos. Lo que ocurre es que en la circuitería del disco hay rutinas para controlar parámetros de salud del disco: tiempo de comienzo de rotación (spin-up time), número de fallos de lectura, temperatura, tiempo de vida… Y todos esos parámetros no son solamente controlados por el propio disco, sino que tienen asignados límites de seguridad, y tanto los parámetros como los límites pueden ser obtenidos por programas que accedan a los discos utilizando las instrucciones I/O apropiadas.


Y ese programa es smartctl, una pieza del paquete Debian smartmontools. Por supuesto, como accede al disco directamente, hay que ser superusuario (root) para usar estas órdenes.


smartctl puede preguntarle al disco por su identificación SMART:



# smartctl -i /dev/sda
smartctl version 5.38 [i686-pc-linux-gnu] Copyright (C) 2002-8 Bruce Allen
Home page is http://smartmontools.sourceforge.net/

=== START OF INFORMATION SECTION ===
Model Family: Fujitsu MHV series
Device Model: FUJITSU MHV2060BH
Serial Number: NW10T652991F
Firmware Version: 00850028
User Capacity: 60,011,642,880 bytes
Device is: In smartctl database [for details use: -P show]
ATA Version is: 7
ATA Standard is: ATA/ATAPI-7 T13 1532D revision 4a
Local Time is: Mon May 12 02:39:31 2008 CEST
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

Más interesante, smartctl puede preguntarle al disco por los valores de sus parámetros:



# smartctl -A /dev/sda
smartctl version 5.38 [i686-pc-linux-gnu] Copyright (C) 2002-8 Bruce Allen
Home page is http://smartmontools.sourceforge.net/

=== START OF READ SMART DATA SECTION ===
SMART Attributes Data Structure revision number: 16
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE
1 Raw_Read_Error_Rate 0x000f 100 100 046 Pre-fail Always - 124253
2 Throughput_Performance 0x0004 100 100 000 Old_age Offline - 18284544
3 Spin_Up_Time 0x0003 100 100 025 Pre-fail Always - 0
4 Start_Stop_Count 0x0032 099 099 000 Old_age Always - 1199
5 Reallocated_Sector_Ct 0x0033 100 100 024 Pre-fail Always - 8589934592000
7 Seek_Error_Rate 0x000e 100 087 000 Old_age Always - 1761
8 Seek_Time_Performance 0x0004 100 100 000 Old_age Offline - 0
9 Power_On_Seconds 0x0032 079 079 000 Old_age Always - 10866h+57m+47s
10 Spin_Retry_Count 0x0012 100 100 000 Old_age Always - 0
12 Power_Cycle_Count 0x0032 100 100 000 Old_age Always - 1199
192 Power-Off_Retract_Count 0x0032 099 099 000 Old_age Always - 283
193 Load_Cycle_Count 0x0032 100 100 000 Old_age Always - 6953
194 Temperature_Celsius 0x0022 100 100 000 Old_age Always - 45 (Lifetime Min/Max 14/58)
195 Hardware_ECC_Recovered 0x001a 100 100 000 Old_age Always - 62
196 Reallocated_Event_Count 0x0032 100 100 000 Old_age Always - 459276288
197 Current_Pending_Sector 0x0012 100 100 000 Old_age Always - 0
198 Offline_Uncorrectable 0x0010 100 100 000 Old_age Offline - 0
199 UDMA_CRC_Error_Count 0x003e 200 200 000 Old_age Always - 0
200 Multi_Zone_Error_Rate 0x000e 100 082 000 Old_age Always - 22371
203 Run_Out_Cancel 0x0002 100 100 000 Old_age Always - 1533257648465
240 Head_Flying_Hours 0x003e 200 200 000 Old_age Always - 0

Como se puede ver, algunos atributos están marcados como “Pre-fail”. Si cualquiera de estos atributos traspasa su límite, el disco está para fallar en cuestión de horas, quizá minutos.


Aunque hay más opciones para smartctl, las últimas que voy a comentar son -a y -t.


smartctl -t lanza una prueba automática de todo el disco. Necesita un parámetro indicando el tipo de prueba, y en el caso más largo puede durar varias decenas de minutos y comprobará el rendimiento eléctrico y mecánico del disco así como el rendimiento de lectura de las cabezas por toda la superficie. smartctl -a, por su parte, muestra toda la información disponible sobre el disco, incluidos los resultados de las pruebas automáticas. Como estas pruebas duran minutos, o decenas de minutos, no podemos observarlas. Todo lo que obtenemos al lanzar una de estas pruebas es:



# smartctl -t long /dev/sda
smartctl version 5.38 [i686-pc-linux-gnu] Copyright (C) 2002-8 Bruce Allen
Home page is http://smartmontools.sourceforge.net/

=== START OF OFFLINE IMMEDIATE AND SELF-TEST SECTION ===
Sending command: "Execute SMART Extended self-test routine immediately in
off-line mode".
Drive command "Execute SMART Extended self-test routine immediately in
off-line mode" successful.
Testing has begun.
Please wait 41 minutes for test to complete.
Test will complete after Mon May 12 05:44:03 2008

Use smartctl -X to abort test.

Aquí se nos informa de que (quizá) tengamos un rendimiento ligeramente menor del disco durante los próximos 41 minutos, porque la prueba ha comenzado. Se produce completamente en segundo plano, o sería mejor decir “fuera de plano”, ya que no ocurre bajo el control del Sistema Operativo en absoluto: todo ocurre internamente al disco, y lo único que vamos a obtener es el resultado.


smartctl -a, por su parte, muestra una enorme cantidad de información SMART sobre el disco: prácticamente toda la información SMART disponible. Normalmente es mejor utilizar una opción específica, como se puede ver en la página de manual (man).


Finalmente, quiero comentar que hay un demonio en el paquete smartmontools, llamado smartd, que se encarga de realizar las pruebas automáticas por uno. Funciona ejecutando smartctl de forma periódica (típicamente cada 30 minutos) y registrando todos los errores y los cambios de los valores de los parámetros en el registro del sistema (syslog). La configuración por defecto en Debian además enviará un mensaje al superusuario con cualquier problema detectado. No voy a explicarlo aquí porque quiero que se lean la documentación, que es concisa y clara, pero recuerden que para usarlo deben activarlo en /etc/default/smartmontools.


El paquete smartmontools ha estado disponible en Debian y Ubuntu desde hace mucho tiempo.



Hay quien ha preguntado por qué en los ejemplos todos los valores aparecen por encima de los límites. Es lo normal: los valores normalizados de los parámetros comienzan típicamente en 100 o 200, y a medida que el disco sufre van descendiendo. El problema lo tenemos cuando un parámetro desciende por debajo de su límite, no cuando está por encima. Aunque también hay que estar atento a las bajadas significativas de los parámetros aunque no leguen a los límites: son signos de que algo malo está pasando.

Como nota, los discos de Seagate tienen la costumbre de poner el parámetro de temperatura en su valor real, lo que lo convierte en uno de los pocos casos en los que un parámetro empeora cuando crece.

lunes, 28 de julio de 2008

Información sobre la batería

Recientemente los núcleos de Linux han dejado de proporcionar la información de la batería que antes se encontraba en /proc/acpi/battery/BAT0 y ahora se considera que utilizar /proc para esas cosas está desaconsejado, debiéndose utilizar /sys. Pero por ningún sitio encontré información sobre en qué sitio de /sys se encuentra ahora esa información.

Y positivamente no es en /sys/bus/acpi, /sys/firmware/acpi ni /sys/module/acpi.

Después de mucho buscar (incluso buceando en los parches de varias herramientas para adaptarse al cambio) lo he encontrado: /sys/class/power_supply.

jueves, 3 de julio de 2008

Maravilloso SunFire

Hoy hemos instalado otra máquina con cuatro procesadores AMD Quad Core de 64 bits como los del TYAN que comentaba ayer. Esta vez, la máquina es una SunFire X4600 M2, de Sun Microsystems. Ha salido más cara por procesador, sin ninguna duda, pero a cambio me gusta más.

Una de las cosas que hacen, sin género de dudas, que esta máquina me guste más que la anterior es su procesador de servicio. Una pequeña tarjeta adicional integrada en la máquina que permite, incluso con la máquina apagada, con tal de que tenga corriente, ver el estado del hardware, encender la máquina, apagarla, reiniciarla, etc. No me cabe ninguna duda de que los fallos que ha estado teniendo la otra máquina, que tiene, repito, los mismo procesadores, caso de que se reprodujeran en esta máquina, hubieran sido más sencillos de atender. Con la otra máquina, cada vez que notábamos que la máquina no respondía, alguien tenía que acercarse a ver qué pasaba y darle al botón. Ahora, si notáramos lo mismo, podríamos conectar al procesador de servicio <<desde la playa>> y ver qué estaría ocurriendo, y en su caso, podríamos reiniciar la máquina sin tener que ir allí. Salvo, claro está, que el problema fuera un corte de luz para todo el armario. Todo eso gracias al sistema ILOM del procesador de servicio, que nos permite, además, acceder por red (HTTP, SNMP y SSH) o por consola serie.

Otra de las grandes ventajas, a mi entender, del SunFire X4600 M2 sobre el ordenador que comentaba ayer es la manera que tiene de organizar los procesadores y la memoria. Allí, cuatro procesadores iban en la placa base, y cuatro en una especie de <<placa base de expansión>>. Aquí los procesadores van, con su memoria asociada, en placas verticales, todas iguales (no cuatro preferentes y cuatro secundarios) que encajan en la placa base individualmente. Aparte de hacer más sencillo el cambio de un procesador (tan tonto como sacar una placa vertical, como se ve en la foto), encuentro el diseño más elegante y mejor pensado.

Otras ventajas, más secundarias desde mi punto de vista, son las cuatro tarjetas de red Gigabit, las cuatro fuentes de alimentación redundantes colocadas en vertical (el otro las tiene en horizontal), los cuatro ventiladores extraíbles (el otro tiene tres, y no forman túnel de aire) y el hecho de que la colocación de las placas de procesador evita una de las pesadillas de un administrador de sistemas en verano: que se estropee un ventilador de procesador. Al X4600 no se le pueden estropear porque no tiene: la ventilación frontal formando túnel de aire, con los procesadores (y sus disipadores de rejilla) justo detrás, hace todo el trabajo.

Entre lo malo está que, a consecuencia de lo anterior, se trata de una máquina que ocupa 4U.


Lo peor, los discos duros. Son discos SAS (eso es una <<Cosa Buena>> ®) pero de 2,5 pulgadas, lo que no permite tener los grandes discos propios de las máquinas de cálculo científico. El mayor disco soportado es de 146GiB, lo que nos da una capacidad total máxima de 576GiB, claramente insuficiente para cálculos científicos masivos, ya que una configuración normal para simulaciones científicas puede tener perfectamente seis discos de 500GiB cada uno. Y no es raro oír acerca de espacios de disco aún mayores. Total, que hemos acabado (gracias $DEITY por darnos RAID) con un espacio de disco de aproximadamente medio TiB para almacenar los resultados.

Eso sí, la instalación de la nueva OpenSuSE 11, recién salida del horno, con su flamante KDE 4, fue una delicia. En un ratito tuvimos la máquina completamente instalada, sin problemas de reconocimiento de <<hardware>> ni nada que se le pareciera. Ya está trabajando, y de momento no se ha caído.

miércoles, 2 de julio de 2008

Algo huele a podrido en OpenSuSE 10

TYAN Transport VX50Una de las cosas que más ocupado me ha tenido estas últimas semanas es un ordenador que se quedaba bloqueado porque sí.

Se trata de una máquina TYAN (un Transport VX50), que venía del distribuidor (una pequeña empresa local, que lo montó en instaló el S. O.) con una placa base TYAN (la Thunder n4250QE (S4985-E)) para cuatro procesadores AMD Quad Core de 64 bits, y una placa de expansión de la placa base también TYAN (la M4985), para montar un total de 8 procesadores de núcleo cuádruple y 128GiB de memoria. Ah, y 8TB de disco.

¿A que mola? El caso es que la máquina, que venía del distribuidor con OpenSuSE 10 (la 11 no había salido aún), se quedaba bloqueada. Como suena. Simplemente estaba trabajando y de repente dejaba de responder. Todo. Ni contestaba al PING ni se veía nada en la pantalla. Y los leds del teclado, parpadeando.

Pensamos que era cosa de la temperatura, así que subimos la velocidad de los ventiladores en la BIOS. Se siguió cayendo.

Pensamos que era cosa del ECC, así que lo desactivamos en la BIOS. No estamos seguros, quizá se caía menos, pero se siguió cayendo.

Pensamos que era cosa de la memoria, así que le corrimos un memtest durante un fin de semana. Con 128GiB pues solamente le dió una vuelta a la memoria, pero estaba limpia. Otras pruebas en la que obligamos a la máquina a swapear de mala manera con cargas del orden de 400 no hicieron caerse la máquina.

Finalmente hemos pensado que fuera cosa del entorno gráfico. A fin de cuentas, ¿quién sabe? ¿Y qué falta hace un entorno gráfico en una máquina de cálculo científico? Hemos desactivado el entorno gráfico pasando el nivel de ejecución del 5 al 3. Y la máquina lleva dos días calculando sin parar.

¿Habremos acertado ya?

Lo peor es que si fuera eso, algo en OpenSuSE 10 (en su entorno gráfico, en particular) no está nada bien. Y de ser así, mi candidato a culpable es earlyxdm.