Archivo de la etiqueta: inversa

Álgebra Superior I: Reducción de Gauss-Jordan

Por Eduardo García Caballero

Introducción

En la entrada anterior vimos que los sistemas de ecuaciones se encuentran íntimamente relacionados con los vectores y las matrices. Teniendo esto en cuenta, en esta entrada abordaremos una estrategia que nos permitirá encontrar soluciones de los sistemas de ecuaciones lineales.

Operaciones elementales por filas

Antes de pasar a describir el algoritmo con el cual podremos resolver un sistema de ecuaciones lineales, deberemos definir algunas operaciones y conceptos que nos ayudaran a efectuarlo. Empecemos con una lista de operaciones que se pueden aplicar a las matrices, las cuales son con conocidas como operaciones elementales por filas.

Para esto, consideremos una matriz
\[
A=
\begin{pmatrix}
5 & \pi & 3 \\
\sqrt{2} & -1 & 2 \\
-1/3 & 4 & 0 \\
9 & -3 & 2/3
\end{pmatrix},
\]
y veamos cómo la afecta cada una de estas operaciones.

La primera de estas operaciones es el reescalamiento. Esta operación consiste en seleccionar una fila de una matriz, y multiplicar cada una de las entradas de esta fila por un mismo número real distinto de cero. Por ejemplo, si reescalamos la tercera fila de $A$ por el número $-3$, obtendremos la matriz
\[
\begin{pmatrix}
5 & \pi & 3 \\
\sqrt{2} & -1 & 2 \\
(-3)(-1/3) & (-3)(4) & (-3)(0) \\
9 & -3 & 2/3
\end{pmatrix}
=
\begin{pmatrix}
5 & \pi & 3 \\
\sqrt{2} & -1 & 2 \\
1& -12 & 0 \\
9 & -3 & 2/3
\end{pmatrix}.
\]

Otra operación que podemos aplicar a las matrices es la trasposición, la cual consiste en intercambiar el contenido de dos filas distintas. Por ejemplo, si transponemos las filas 2 y 4 de $A$, el resultado será la matriz
\[
\begin{pmatrix}
5 & \pi & 3 \\
9 & -3 & 2/3 \\
-1/3 & 4 & 0 \\
\sqrt{2} & -1 & 2
\end{pmatrix}.
\]

La última de las operaciones que nos interesa es la transvección. Esta consiste en sumar el múltiplo de una fila (el resultado de multiplicar cada entrada de una fila por un mismo escalar) a otra fila (la suma se realiza entrada por entrada). Por ejemplo, si en $A$ realizamos la transvección que corresponde a “sumar 3/2 de la cuarta fila a la primera fila”, obtendremos la matriz
\[
\begin{pmatrix}
5 + (3/2)(9) & \pi+(3/2)(-3) & 3+(3/2)(2/3) \\
\sqrt{2} & -1 & 2 \\
-1/3 & 4 & 0 \\
9 & -3 & 2/3
\end{pmatrix}
=
\begin{pmatrix}
37/2 & -9/2+\pi & 4 \\
\sqrt{2} & -1 & 2 \\
-1/3 & 4 & 0 \\
9 & -3 & 2/3
\end{pmatrix}.
\]

Si recuerdas, todos los sistemas de ecuaciones se pueden escribir como $Ax=b$. Las operaciones elementales son muy importantes por las siguientes dos razones:

Si aplicamos la misma operación elemental a $A$ y $b$ para obtener la matriz $A’$ y el vector $b’$, entonces $Ax=b$ y $A’x=b’$ tienen exactamente el mismo conjunto solución. Decimos que «las operaciones elementales no cambian las soluciones del sistema».
Usando operaciones elementales se puede llevar el sistema $Ax=b$ a un sistema mucho más sencillo $A_{red}x=b_{red}$ (que discutiremos más abajo). Entonces «las operaciones ayudan a simplificar un sistema de ecuaciones».

Juntando ambas observaciones, con operaciones elementales podemos llevar cualquier sistema de ecuaciones a uno mucho más sencillo y con el mismo conjunto solución.

Puedes intentar convencerte de la primera afirmación pensando en lo siguiente. En un reescalamiento de filas corresponde a multiplicar por una constante no nula ambos lados de una ecuación; la transposición corresponde a cambiar el orden en el que aparecen dos ecuaciones diferentes; mientras que la transvección corresponde a sumar un múltiplo de una ecuación a otra ecuación, y el sistema tiene las mismas soluciones pues, si un conjunto de valores es solución para dos ecuaciones, entonces es solución para cualquier combinación lineal de estas. En un curso de Álgebra Lineal I puedes encontrar las justificaciones con mucho más detalle.

En las siguientes secciones hablamos un poco más de la segunda afirmación.

Forma escalonada y escalonada reducida para una matriz

Además de las operaciones elementales por filas, es importante definir algunos conceptos.

Comencemos con el concepto de pivote: diremos que una entrada de una matriz es un pivote si es el primer elemento distinto de cero en una fila.

Diremos que una matriz se encuentra en forma escalonada si se cumple: 1. Todas las filas nulas se encuentran hasta abajo; 2. Todos los pivotes de filas no-nulas tienen valor 1; 3. El pivote de cada fila se encuentra la derecha del pivote de una fila superior. Es fácil identificar las matrices en forma escalonada porque parecen “estar en escalerita”. Por ejemplo, la matriz
\[
\begin{pmatrix}
1 & 9 & 1 & 1 \\
0 & 1 & 2 & 3 \\
0 & 0 & 1 & 1
\end{pmatrix}
\]
se encuentra en forma escalonada, mientras que las matrices
\[
\begin{pmatrix}
1 & 0 & 2 & 4 \\
0 & 0 & 9 & 2 \\
0 & 3 & 0 & 0
\end{pmatrix}
\qquad
\text{y}
\qquad
\begin{pmatrix}
0 & 6 & 8 & -5 \\
0 & 0 & 0 & 0 \\
0 & 0 & 9 & 2
\end{pmatrix}
\]
no lo están. ¿Puedes justificar por qué?

Por su parte, diremos que una matriz se encuentra en forma escalonada reducida si está en forma escalonada y, además, si hay un pivote en alguna fila, todas las entradas que no sean pivote en la misma columna del pivote son iguales a $0$ (Ojo. Siempre hablamos de pivotes de renglones).

Por ejemplo, la matriz
\[
\begin{pmatrix}
1 & 0 & -1 & 0 \\
0 & 1 & 3 & 0 \\
0 & 0 & 0 & 1
\end{pmatrix}
\]
está en forma escalonada reducida.

Como recordarás de la entrada anterior, un sistema de ecuaciones lineales
\[
\begin{cases}
a_{11}x_1 + a_{12}x_2 + \cdots + a_{1n}x_n & = b_1 \\
a_{21}x_1 + a_{22}x_2 + \cdots + a_{2n}x_n & = b_2 \\
& \vdotswithin{\mspace{15mu}} \\
a_{m1}x_1 + a_{m2}x_2 + \cdots + a_{mn}x_n &= b_m
\end{cases}
\]
se puede codificar como
\[
\begin{pmatrix}
a_{11} & a_{12} & \cdots & a_{1n} \\
a_{21} & a_{22} & \cdots & a_{2n} \\
\vdots & \vdots & \ddots & \vdots \\
a_{m1} & a_{m2} & \cdots & a_{mn}
\end{pmatrix}
\begin{pmatrix}
x_1 \\
x_2 \\
\vdots \\
x_n
\end{pmatrix}
=
\begin{pmatrix}
b_1 \\
b_2 \\
\vdots \\
b_m
\end{pmatrix}.
\]

Como podemos cambiar el nombre de las variables, pero el vector de soluciones sigue siendo el mismo, es común codificar el sistema como una única matriz aumentada
\[
\left(
\begin{matrix}
a_{11} & a_{12} & \cdots & a_{1n} \\
a_{21} & a_{22} & \cdots & a_{2n} \\
\vdots & \vdots & \ddots & \vdots \\
a_{m1} & a_{m2} & \cdots & a_{mn}
\end{matrix}
\
\middle|
\
\begin{matrix}
b_1 \\
b_2 \\
\vdots \\
b_m
\end{matrix}
\right).
\]

Aquí pusimos una línea vertical, pero sólo es por ayuda visual. Esa matriz la puedes tratar como cualquier matriz que hemos platicado.

Teniendo esto en cuenta, las matrices en forma escalonada reducida nos son de gran utilidad al resolver sistemas de ecuaciones lineales. Por ejemplo, consideremos el sistema
\[
\begin{cases}
x + 3y + 2w &= 8 \\
z + w &= 9,
\end{cases}
\]
el cual tiene como matriz aumentada a
\[
\left(
\begin{matrix}
1 & 3 & 0 & 2 \\
0 & 0 & 1 & 1
\end{matrix}
\
\middle|
\
\begin{matrix}
8 \\
9
\end{matrix}
\right),
\]
la cual se encuentra en forma escalonada.

Gracias a que la matriz está en forma escalonada, podemos elegir en orden inverso $w$, $z$, $y$, $x$ a las variables libres y pivote como en la entrada anterior. En este caso, podemos elegir como queramos el valor de $w$ ($w$ es variable libre). Usando la segunda ecuación, podemos despejar $z$ en términos de $w$ ($z$ es variable pivote). Estos dos valores los sustituimos en la primera ecuación y notamos que $y$ puede ser lo que queramos ($y$ es variable libre). Finalmente, $x$ queda totalmente determinado por las demás variables ($x$ es pivote). Las variables pivote justo corresponden a columnas de la matriz que tengan pivote de alguna fila.

La ventaja de la forma escalonada es que podremos ir obteniendo fácilmente el valor de cada variable “de abajo hacia arriba”. En el caso de un sistema cuya matriz se encuentre en forma escalonada reducida, será aún más sencillo pues ya no tendremos que sustituir valores y obtenemos el despeje directamente.

Teorema de reducción de Gauss-Jordan

El siguiente teorema relaciona las operaciones elementales por filas con la forma escalonada reducida de una matriz.

Teorema (de reducción de Gauss-Jordan o reducción gaussiana). Cualquier matriz con entradas reales se puede a una forma escalonada reducida aplicando una cantidad finita de pasos.

A continuación presentamos un algoritmo con el cual podemos pasar de una matriz arbitraria a una matriz en su forma escalonada reducida. Para hacer más sencilla su aplicación, nos enfocaremos en comprender la estrategia que sigue el algoritmo. La descripción formal del algoritmo y demostración de que en efecto funciona como esperamos es un tema que abordarás en el curso de Álgebra Lineal I (puedes echarle un ojo a esta entrada).

Primeramente, describiremos los pasos del algoritmo, al que se le conoce como reducción de Gauss-Jordan o reducción gaussiana.

Estrategia: Iremos arreglando la matriz de izquierda a derecha. Para ello, haremos los siguientes pasos repetidamente.

Buscamos la primera columna de la matriz (de izquierda a derecha) que no tenga puros ceros.
Una vez encontrada dicha columna, buscamos la primera entrada (de arriba hacia abajo) que no sea cero.
Pasamos la fila que contiene a dicha entrada hasta arriba mediante la operación de transposición.
Multiplicamos cada entrada de la fila que acabamos de mover hasta arriba por el inverso multiplicativo de su primera entrada (aquí usamos la operación de reescalamiento). La primera entrada de esta fila ahora será 1.
Mediante la operación de transvección, sustraemos múltiplos de la primera fila al resto de renglones de la matriz, de modo que el resto de los valores en la columna correspondiente a la primera entrada de la fila en la que estamos trabajando pasen a ser 0 (como puedes observar, la entrada primera entrada no-nula de la fila en la que estamos trabajando ahora será un pivote).
Ignorando la primera fila, buscamos la primera columna (de izquierda a derecha) que no tenga puros ceros.
Repetimos los pasos anteriores (2 a 6), pero ahora, en vez de mover la fila con la que estamos trabajando “hasta arriba”, la moveremos inmediatamente después de la última fila con la que trabajamos.
Hacemos esto hasta haber arreglado todas las columnas.

Ejemplo de reducción de Gauss-Jordan

Ahora, como ejemplo, veamos cómo podemos implementar este algoritmo en la matriz
\[
\begin{pmatrix}
0 & 1 & 2 & 3 & 4 \\
-1 & 0 & 1 & 2 & 3 \\
3 & 1 & -1 & 0 & 2 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix},
\]
la cual, si la consideramos como la matriz aumentada
\[
\left(
\begin{matrix}
0 & 1 & 2 & 3 \\
-1 & 0 & 1 & 2 \\
3 & 1 & -1 & 0 \\
0 & 1 & 1 & 1
\end{matrix}
\
\middle|
\
\begin{matrix}
4 \\
3 \\
2 \\
1
\end{matrix}
\right),
\]
corresponde al sistema de ecuaciones
\[
\begin{cases}
y + 2z + 3w &= 4 \\
-x + z + 2w &= 2 \\
3x + y -z &= 0 \\
y + z + w &= 1.
\end{cases}
\]

Buscamos la primera la primera columna no nula, la cual resulta ser la primera columna de la matriz. En esta columna, vemos que la segunda entrada es la primera entrada distinta de cero. Entonces, mediante trasposicón, intercambiamos las filas 1 y 2 (“movemos la segunda columna hasta arriba”):
\[
\begin{pmatrix}
-1 & 0 & 1 & 2 & 3 \\
0 & 1 & 2 & 3& 4 \\
3 & 1 & -1 & 0 & 2 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}.
\]

Ahora, nos fijamos en la primera entrada no nula de la primera fila, que es $-1$, y reescalamos la fila por su inverso multiplicativo, que es $-1$:
\[
\begin{pmatrix}
(-1)(-1) & (-1)(0) & (-1)(1) & (-1)(2) & (-1)(3) \\
0 & 1 & 2 & 3 & 4 \\
3 & 1 & -1 & 0 & 2 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
3 & 1 & -1 & 0 & 2 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}.
\]

Ahora, observamos el valor de la primera entrada de la tercera fila, el cual es $3$. Entonces, mediante transvección, sumamos $-3$ veces la fila 1 a la fila 3:
\[
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
3+(-3)(1) & 1+(-3)(0) & -1+(-3)(-1) & 0+(-3)(-2) & 2+(-3)(-3) \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 1 & 2 & 6 & 11 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix},
\]
y realizamos lo mismo, pero ahora considerando la fila 4.
\[
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 1 & 2 & 6 & 11 \\
0+(0)(1) & 1+(0)(0) & 1+(0)(-1) & 1+(0)(-2) & 1+(0)(-3)
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 1 & 2 & 6 & 11 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}
\]
Como puedes observar, ninguna de las transvecciones influye en la otra, de manera que las podemos enlistar en un único paso. Además, al hacer una transvección con escalar $0$ no cambia nada de la fila, así que estas no se necesita hacerlas.

Ahora, ignorando la última fila con la que trabajamos (que es la primera), buscamos la primera columna no-nula, que en este caso será la segunda, posteriormente buscamos el primer elemento no nulo de la columna, el cual se encuentra en la segunda fila, y la “movemos enseguida de la última fila con la que trabajamos” (en este caso no tendríamos que realizar ninguna transposición, o bien, la transposición sería la de la segunda fila consigo misma, ya que ya se encuentra en seguida de la última fila con la que trabajamos). Después, reescalamos por el inverso multiplicativo del primer elemento no nulo de la fila, que es $1$:
\[
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
(1)(0) & (1)(1) & (1)(2) & (1)(3) & (1)(4) \\
0 & 1 & 2 & 6 & 11 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 1 & 2 & 6 & 11 \\
0 & 1 & 1 & 1 & 1
\end{pmatrix}
\]
(observa que reescalar por $1$ deja todas las entradas iguales) y posteriormente realizamos las transvecciones necesarias para que el resto de entradas de la segunda columna sean cero.
\[
\begin{pmatrix}
1 & 0+(0)(1) & -1+(0)(2) & -2+(0)(3) & -3+(0)(4) \\
0 & 1 & 2 & 3 & 4 \\
0 & 1+(-1)(1) & 2+(-1)(2) & 6+(-1)(3) & 11+(-1)(4) \\
0 & 1+(-1)(1) & 1+(-1)(2) & 1+(-1)(3) & 1+(-1)(4)
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 0 & 0 & 3 & 7 \\
0 & 0 & -1 & -2 & -3
\end{pmatrix}
\]

De manera similar, ignorando ahora las primeras dos filas, buscamos la primera columna no-nula, la cual corresponde ahora a la tercera, y buscamos el primer elemento no-nulo de esta columna, el cual se encuentra en la cuarta fila. Entonces, transponemos las filas 3 y 4 para que el primer elemento no-nulo quede inmediatamente después de la última fila con la que trabajamos:
\[
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 0 & -1 & -2 & -3 \\
0 & 0 & 0 & 3 & 7
\end{pmatrix}.
\]

Seguidamente, reescalamos la tercera fila,
\[
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
(-1)(0) & (-1)(0) & (-1)(-1) & (-1)(-2) & (-1)(-3) \\
0 & 0 & 0 & 3 & 7
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & -1 & -2 & -3 \\
0 & 1 & 2 & 3 & 4 \\
0 & 0 & 1 & 2 & 3 \\
0 & 0 & 0 & 3 & 7
\end{pmatrix}
\]
y relizamos las transvecciones necesarias:
\[
\begin{pmatrix}
1+(1)(0) & 0+(1)(0) & -1+(1)(1) & -2+(1)(2) & -3+(1)(3) \\
0+(-2)(0) & 1+(-2)(0) & 2+(-2)(1) & 3+(-2)(2) & 4+(-2)(3) \\
0 & 0 & 1 & 2 & 3 \\
0 & 0 & 0 & 3 & 7
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & 0 & 0 & 0 \\
0 & 1 & 0 & -1 & -2 \\
0 & 0 & 1 & 2 & 3 \\
0 & 0 & 0 & 3 & 7
\end{pmatrix}.
\]

Finalmente, como nuestra última columna no cero es la cuarta y la primera fila no cero (ignorando las filas que ya tienen pivote) tiene un $3$, reescalamos de la siguiente manera:
\[
\begin{pmatrix}
1 & 0 & 0 & 0 & 0 \\
0 & 1 & 0 & -1 & -2 \\
0 & 0 & 1 & 2 & 3 \\
(1/3)(0) & (1/3)(0) & (1/3)(0) & (1/3)(3) & (1/3)(7)
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & 0 & 0 & 0 \\
0 & 1 & 0 & -1 & -2 \\
0 & 0 & 1 & 2 & 3 \\
0 & 0 & 0 & 1 & 7/3
\end{pmatrix},
\]

Y hacemos las transvecciones necesarias:
\[
\begin{pmatrix}
1 & 0 & 0 & 0 & 0 \\
0+(1)(0) & 1+(1)(0) & 0+(1)(0) & -1+(1)(1) & -2+(1)(7/3) \\
0+(-2)(0) & 0+(-2)(0) & 1+(-2)(0) & 2+(-2)(1) & 3+(-2)(7/3) \\
0 & 0 & 0 & 1 & 7/3
\end{pmatrix}
=
\begin{pmatrix}
1 & 0 & 0 & 0 & 0 \\
0 & 1 & 0 & 0 & 1/3 \\
0 & 0 & 1 & 0 & -5/3 \\
0 & 0 & 0 & 1 & 7/3
\end{pmatrix}.
\]

Notemos que si consideramos esta matriz como la matriz aumentada
\[
\left(
\begin{matrix}
1 & 0 & 0 & 0 \\
0 & 1 & 0 & 0 \\
0 & 0 & 1 & 0 \\
0 & 0 & 0 & 1
\end{matrix}
\
\middle|
\
\begin{matrix}
0 \\
1/3 \\
-5/3 \\
7/3
\end{matrix}
\right),
\]
este corresponde al sistema
\[
\begin{cases}
x = 0 \\
y = 1/3 \\
z = -5/3 \\
w = 7/3,
\end{cases}
\]
del cual sabemos inmediatamente su solución. Como mencionamos anteriormente, los sistemas de ecuaciones asociados a la matriz original y la matriz escalonada reducida resultante de aplicar operaciones elementales por filas, consideradas como matrices aumentadas, tienen las mismas soluciones. Entonces, ¡este último sistema es la solución para nuestro sistema de ecuaciones original!

Como podemos ver, los sistemas de ecuaciones asociados a una matriz en su forma escalonada reducida son fáciles de resolver por que vamos escogiendo valores arbitrarios para las variables en posición que no es pivote, mientras que podemos obtener el valor de las variables que son pivote mediante despejes sencillos.

Recuerda que este algoritmo funciona para cualquier matriz con entradas reales. ¿Podrías proponer otro sistema de ecuaciones e implementar la misma estrategia para resolverlo?

Más adelante…

Ahora vimos una estrategia para resolver sistemas de ecuaciones lineales de distintos tamaños. En las siguientes entradas conoceremos más propiedades sobre las matrices. Estas nuevas propiedades también juegan un rol fundamental en poder determinar de manera más rápida cuándo un sistema de ecuaciones lineales tiene solución, y tener otras alternativas para resolverlo bajo ciertas condiciones.

Tarea moral

Aplica reducción gaussiana a las siguientes matrices:
$$\begin{pmatrix} 5 & 2 \\ 13 & 5 \end{pmatrix},\quad \begin{pmatrix} 1 & 1 & 0 \\ 1 & 0 & 1 \\ 0 & 1 & 1 \end{pmatrix}.$$
Resuelve el siguiente sistema de ecuaciones llevándolo a forma escalonada reducida, y luego aplicando a técnica de variables libres y pivote:
$$\begin{cases} a + b + c + d + e &= -5\\2a+2b-3c-3d+e&=5 \\ a – b + c – d + e &= 0. \end{cases}$$
Sea $I$ la matriz identidad de $n\times n$ y $A$ otra matriz de $n\times n$. Sea $E$ la matriz obtenida de aplicar una transvección a $I$. Sea $B$ la matriz de aplicar esa misma transvección a $A$. Demuestra que $EA=B$.
Demuestra que una matriz $A$ de $2\times 2$ es invertible si y sólo si al aplicar reducción de Gauss-Jordan al final se obtiene la matriz identidad $I$. ¿Puedes hacerlo para matrices de $3\times 3$? ¿De $n\times n$?
Sea $A$ una matriz de $2\times 2$ invertible. A $A$ le «pegamos» una identidad del mismo tamaño a la derecha para llegar a $(A|I)$, por ejemplo $\begin{pmatrix} a & b \\ c & d \end{pmatrix}$ se convertiría en $\begin{pmatrix} a & b & 1 & 0 \\ c & d & 0 & 1 \end{pmatrix}$. Muestra que si aplicamos reducción de Gauss-Jordan a $(A|I)$, se llega a $(I|A^{-1})$. Intenta extender tu demostración a matrices de $3\times 3$ ó $n\times n$.

Entradas relacionadas

Ir a Álgebra Superior I
Entrada anterior del curso: Sistemas de ecuaciones lineales
Entrada siguiente del curso: Traza de matrices y propiedades

Álgebra Superior I: Matrices invertibles

Por Eduardo García Caballero

2 respuestas

Introducción

En la entrada anterior definimos el producto de matrices con matrices y exploramos algunas de sus propiedades, siendo varias de estas familiares: el producto de matrices es asociativo, conmutativo y tiene elemento neutro. En esta entrada exploraremos una pregunta que quedó abierta: ¿el producto de matrices cumple con tener inversos?

Definición de matrices invertibles

Diremos que una matriz cuadrada $A$ es invertible si y sólo si tiene inverso multiplicativo; es decir, si existe una matriz $B$ tal que $AB = BA = \mathcal{I}$.

Observemos para que la definción anterior tenga sentido, es indispensable que $A$ sea cuadrada, pues veamos que si $A$ es de tamaño $m \times n$, entonces para que los productos $AB$ y $BA$ estén definidos, $B$ tendrá que ser de tamaño $n \times m$. Así, $AB$ será de tamaño $m\times n$ y $BA$ de tamaño $n\times n$, y como $AB = BA$, entonces $m = n$, y, por tanto, $AB = BA = \mathcal{I}_n$ (y con ello también observamos que $B$ tiene que ser cuadrada de tamaño $n \times n$).

Un ejemplo de una matriz de $2 \times 2$ que es invertible es
\[
A
=
\begin{pmatrix}
1 & -2 \\
-3 & 5
\end{pmatrix}
\]
que tiene como inversa a la matriz
\[
B
=
\begin{pmatrix}
-5 & -2 \\
-3 & -1
\end{pmatrix},
\]
pues
\begin{align*}
AB
&=
\begin{pmatrix}
1 & -2 \\
-3 & 5
\end{pmatrix}
\begin{pmatrix}
-5 & -2 \\
-3 & -1
\end{pmatrix}\\
&=
\begin{pmatrix}
(1)(-5) + (-2)(-3) & (1)(-2) + (-2)(-1) \\
(-3)(-5) + (5)(-3) & (-3)(-2) + (5)(-1)
\end{pmatrix}\\
&=
\begin{pmatrix}
1 & 0 \\
0 & 1
\end{pmatrix}\\
&=
\mathcal{I}_2
\end{align*}
y
\begin{align*}
BA
&=
\begin{pmatrix}
-5 & -2 \\
-3 & -1
\end{pmatrix}
\begin{pmatrix}
1 & -2 \\
-3 & 5
\end{pmatrix}\\
&=
\begin{pmatrix}
(-5)(1) + (-2)(-3) & (-5)(-2) + (-2)(5) \\
(-3)(1) + (-1)(-3) & (-3)(-2) + (-1)(5)
\end{pmatrix}\\
&=
\begin{pmatrix}
1 & 0 \\
0 & 1
\end{pmatrix}\\
&=
\mathcal{I}_2.
\end{align*}
Por lo tanto,
\[
AB = BA = \mathcal{I}_2.
\]

Algo que seguramente te preguntarás es si cualquier matriz cuadrada tiene un inverso multiplicativo. A diferencia de otros tipos de operaciones con inversos, el producto de matrices no siempre cumple con tenerlos: un ejemplo de esto es la matriz
\[
A=
\begin{pmatrix}
2 & 1 \\
0 & 0
\end{pmatrix}
\]
la cual, al multiplicarla por cualquier matriz
\[
B
=
\begin{pmatrix}
a & b \\
c & d
\end{pmatrix}
\]
por la derecha, nos da como resultado
\[
AB
=
\begin{pmatrix}
2 & 1 \\
0 & 0
\end{pmatrix}
\begin{pmatrix}
a & b \\
c & d
\end{pmatrix}
=
\begin{pmatrix}
2a + c & 2b + ,d \\
0 & 0
\end{pmatrix},
\]
y como en cualquier caso obtenemos que su entrada en la posición $(2,2)$ es $0$, tenemos que $AB$ es distinta a $\mathcal{I}_2$, pues la entrada en la posición $(2,2)$ de esta última es $1$.

Propiedades de matrices invertibles

A continuación exploraremos algunas de las propiedades que cumplen las matrices invertibles.

Primeramente, veamos que si una matriz $A$ de $n \times n$ es invertible, entonces su inversa será única. Para demostrar esto, supongamos que $B$ y $C$ son ambas inversas multiplicativas de $A$; es decir, $AB = BA = \mathcal{I}_n$ y $AC = CA = \mathcal{I}_n$. Entonces,
\begin{align*}
AB &= AC \\[5pt]
B(AB) &= B(AC) \\[5pt]
(BA)B &= (BA)C \\[5pt]
\mathcal{I}_n B &= \mathcal{I}_n C \\[5pt]
B &= C.
\end{align*}

Como la matriz inversa de $A$ es única, usualmente la denotamos como $A^{-1}$.

Por otra parte, veamos que si $A$ y $B$ son matrices invertibles, con inversas $A^{-1}$ y $B^{-1}$, respectivamente, entonces, si podemos multiplicar $A$ y $B$ (es decir, si $A$ y $B$ son del mismo tamaño), entonces $AB$ es invertible, pues se cumple que
\[
(AB)(B^{-1}A^{-1}) = A(BB^{-1})A^{-1} = A\mathcal{I}_nA^{-1} = AA^{-1} = \mathcal{I}_n,
\]
y también que
\[
(B^{-1}A^{-1})(AB) = B^{-1}(A^{-1}A)B = B^{-1}\mathcal{I}_nB = B^{-1}B = \mathcal{I}_n,
\]
es decir, $B^{-1}A^{-1}$ es la matriz inversa de $AB$, lo cual denotamos como $(AB)^{-1} = B^{-1}A^{-1}$.

Finalmente, recordando la interpretación geométrica que dimos a la multiplicación de matrices por vectores, y la propiedad de que $A(Bu) = (AB)u$, entonces notamos que
\[
A^{-1}(Au) = (A^{-1}A)u = \mathcal{I}u = u.
\]

Como la transformación correspondiente a $A$ envía el vector $u$ al vector $Au$, y como el resultado de aplicar $(A^{-1}A)u$ deja al vector $u$ en su lugar, esto nos dice que la transformación correspondiente a $A^{-1}$ es aquella que regresa el vector $Au$ a su posición original.

En la siguiente imagen se visualiza esta propiedad para el caso en el que
\[
A
=
\begin{pmatrix}
3 & 1 \\
4 & 2
\end{pmatrix}
\qquad
\text{y}
\qquad
u
=
\begin{pmatrix}
1 \\
2
\end{pmatrix}.
\]

Formula para inversa de matrices de $2 \times 2$

Más arriba vimos que hay matrices que sí tienen inversa, mientras que otras no tienen. Para el caso de matrices de $2 \times 2$, tendremos que
\[
A
=
\begin{pmatrix}
a & b \\
c & d
\end{pmatrix}
\]
es invertible si y sólo si se cumple que $ad-bc \ne 0$.

En dado caso, la inversa de $A$ será la matriz
\[
A^{-1}
=
\frac{1}{ad-bc}
\begin{pmatrix}
d & -b \\
-c & a
\end{pmatrix}
=
\begin{pmatrix}
\frac{d}{ad-bc} & \frac{-b}{ad-bc} \\
\frac{-c}{ad-bc} & \frac{a}{ad-bc}
\end{pmatrix}.
\]

Por ejemplo, veamos que si
\[
A =
\begin{pmatrix}
a & b \\
c & d
\end{pmatrix}
=
\begin{pmatrix}
1 & 2 \\
-2 & 3
\end{pmatrix},
\]
entonces $ad – bc = (1)(3) – (2)(-2) = 3 – (-4) = 7 \ne 0$, por lo que podemos garantizar que $A$ tiene matriz inversa, la cual es
\[
A^{-1}
=
\frac{1}{ad-bc}
\begin{pmatrix}
d & -b \\
-c & a
\end{pmatrix}
=
\frac{1}{7}
\begin{pmatrix}
3 & -2 \\
2 & 1
\end{pmatrix}
=
\begin{pmatrix}
3/7 & -2/7 \\
2/7 & 1/7
\end{pmatrix}.
\]

Verificamos que
\begin{align*}
AA^{-1}
&=
\begin{pmatrix}
1 & 2 \\
-2 & 3
\end{pmatrix}
\begin{pmatrix}
3/7 & -2/7 \\
2/7 & 1/7
\end{pmatrix}\\
&=
\begin{pmatrix}
(1)(3/7) + (2)(2/7) & (1)(-2/7) + (2)(1/7) \\
(-2)(3/7) + (3)(2/7) & (-2)(-2/7) + (3)(1/7)
\end{pmatrix}\\
&=
\begin{pmatrix}
1 & 0 \\
0 & 1
\end{pmatrix}\\
&=
\mathcal{I}_2
\end{align*}
y
\begin{align*}
A^{-1}A
&=
\begin{pmatrix}
3/7 & -2/7 \\
2/7 & 1/7
\end{pmatrix}
\begin{pmatrix}
1 & 2 \\
-2 & 3
\end{pmatrix}\\
&=
\begin{pmatrix}
(3/7)(1) + (-2/7)(-2) & (3/7)(2) + (-2/7)(3) \\
(2/7)(1) + (1/7)(-2) & (2/7)(2) + (1/7)(3)
\end{pmatrix}\\
&=
\begin{pmatrix}
1 & 0 \\
0 & 1
\end{pmatrix}\\
&=
\mathcal{I}_2.
\end{align*}

De manera similar, veamos que la matriz
\[
\begin{pmatrix}
3 & 4 \\
1 & 2
\end{pmatrix}
\]
es invertible pues $(3)(2) – (4)(1) = 2 \ne 0$. ¿Puedes calcular su inversa?

Por el contrario, veamos que en la matriz
\[
\begin{pmatrix}
6 & 4 \\
3 & 2
\end{pmatrix}
\]
tenemos que $(6)(2) – (4)(3) = 12 -12 = 0$, y, por tanto, no es invertible.

Para el caso de matrices de mayor tamaño, también existen condiciones y fórmulas para calcular sus inversas, sin embargo, estas no resultan tan sencillas. Será necesario que comprendamos más propiedades de las matrices para poder obtenerlas.

Más adelante…

En esta entrada conocimos una propiedad más que cumplen las matrices respecto a su producto, que es la de tener inverso multiplicativas; también vimos las condiciones bajo las cuales una matriz de $2 \times 2$ puede tener inverso, y revisamos su fórmula.

En la siguiente entrada, conoceremos una nueva operación, la cual se distinguirá de todas las que hemos visto hasta ahora, pues esta operación involucra a una única matriz a la vez.

Tarea moral

¿Para qué valores de $a$ se cumple que
\[
\begin{pmatrix}
5 & a \\
2 & 2-a
\end{pmatrix}
\]
es invertible?
Muestra que si $A$, $B$ y $C$ son matrices invertibles del mismo tamaño, entonces
\[
(ABC)^{-1} = C^{-1}B^{-1}A^{-1}.
\]
Muestra que si $A$ es una matriz invertible y $k$ es un entero positivo, entonces $A^k$ también es invertible y $(A^k)^{-1}=(A^{-1})^k$.
¿Por qué la matriz
\[
\begin{pmatrix}
3 & 4 & 0 \\
7 & 2 & 0 \\
0 & 0 & 0
\end{pmatrix}
\]
no es invertible?
Muestra que en efecto el criterio que dimos para que una matriz $A=\begin{pmatrix} a & b \\ c & d \end{pmatrix}$ tenga inversa es suficiente y necesario. Para la parte de que es suficiente, tendrás que ver que si $ad-bc\neq 0$, la matriz propuesta en la entrada siempre funciona como inversa. Para ver que es necesario, supón que $ad-bc=0$. En este caso, $ad=bc$ y podrás encontrar a partir de $a,b,c,d$ a dos vectores distintos $u$ y $v$ tales que $Au=Av$. Esto mostrará que la transformación asociada a $A$ no es inyectiva y por tanto no podrá tener inversa, así que $A$ tampoco tendrá inversa.

Entradas relacionadas

Ir a Álgebra Superior I
Entrada anterior del curso: Producto de matrices con matrices
Entrada siguiente del curso: Transposición de matrices, matrices simétricas y antisimétricas

Cálculo Diferencial e Integral III: Demostración del teorema de la función inversa

Por Alejandro Antonio Estrada Franco

Deja un comentario

Introducción

En la entrada anterior empezamos a hablar del teorema de la función inversa. Dimos su enunciado y probamos varias herramientas que nos ayudarán ahora con su demostración.

Recordemos que lo que queremos demostrar es lo siguiente.

Teorema (de la función inversa). Sea $f:S\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ de clase $C^{1}$ en el abierto $S$. Si $Df(\bar{a})$ es invertible, entonces, existe $\delta >0$ tal que:

$B_{\delta}(\bar{a})\subseteq S$ y $f$ es inyectiva en $B_{\delta}(\bar{a})$.
$f^{-1}:f(B_{\delta}(\bar{a}))\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ es continua en $f(B_{\delta}(\bar{a}))$.
$f(B_{\delta}(\bar{a}))\subseteq \mathbb{R}^{n}$ es un conjunto abierto.
$f^{-1}$ es de clase $C^{1}$ en $f(B_{\delta}(\bar{a}))$ y además, si $\bar{x}=f(\bar{v})\in f(B_{\delta}(\bar{a}))$, entonces, $Df^{-1}(\bar{x})=Df^{-1}(f(\bar{v}))=(Df(\bar{v}))^{-1}$.

La herramienta más importante que probamos en la entrada anterior nos dice que si una función $f:S\subseteq \mathbb{R}^n\to \mathbb{R}^n$ es de clase $C^1$, $\bar{a}\in S$ y $DF(\bar{a})$ es invertible, entonces existe una $\delta>0$ tal que $B_\delta(\bar{a})\subseteq S$ y $Df(\bar{b})$ es invertible para todo $\bar{b}\in B_\delta(\bar{a})$. Veremos cómo esta herramienta y otras que desarrollaremos en el transcurso de esta entrada nos permiten demostrar el teorema.

La función $f$ es inyectiva en una vecindad de $\bar{a}$

Vamos a enfocarnos en el punto $(1)$ del teorema. Veremos que existe la $\delta$ que hace que la función restringida a la bola de radio $\delta$ centrada en $\bar{a}$ es inyectiva. En esta parte de la prueba es conveniente que recuerdes que la norma infinito de un vector $(x_1,\ldots,x_n)\in \mathbb{R}^n$ es $$||\bar{x}||_{\infty}:=máx\{ |x_{1}|,\dots ,|x_{n}|\}.$$

Además, cumple para todo $\bar{x}\in \mathbb{R}^{n}$ que $$||\bar{x}||\leq \sqrt{n} ||\bar{x}||_{\infty}.$$

Veamos que bajo las hipótesis del problema se puede acotar $||f(\bar{u})-f(\bar{v})||$ en términos de $||\bar{u}-\bar{v}||$ dentro de cierta bola.

Proposición. Sea $f:S\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ de clase $C^{1}$ en el conjunto abierto $S$, y $\bar{a}\in S$. Si $Df(\bar{a})$ es invertible, entonces existe $\delta >0$ y $\varepsilon>0$ tal que $B_{\delta}(\bar{a})\subseteq S$ y $||f(\bar{u})-f(\bar{v})||\geq \varepsilon||\bar{u}-\bar{v}||$ para cualesquiera $\bar{u},\bar{v}\in B_{\delta}(\bar{a})$.

Demostración. Por la diferenciabilidad de $f$ en $\bar{a}$, tenemos

\[ Df(\bar{a})(\bar{x})=\begin{pmatrix} \triangledown f_{1}(\bar{a})\cdot \bar{x} \\ \vdots \\ \triangledown f_{n}(\bar{a})\cdot \bar{x}\end{pmatrix} \]

para cada $\bar{a}\in S$ y cada $\bar{x}\in \mathbb{R}^{n}$.

Como $Df(\bar{a})$ es invertible, por los resultados de la entrada anterior existe un $m>0$ tal que

\[ ||Df(\bar{a})(\bar{x})||\geq m||\bar{x}|| \]

para todo $\bar{x}\in \mathbb{R}^{n}$.

También por resultados de la entrada anterior, para $\epsilon:=\frac{m}{2\sqrt{n}}>0$ existe $\delta >0$ tal que si $\bar{b}\in B_{\delta}(\bar{a})\subseteq S$ entonces

\[||(Df(\bar{b})-Df(\bar{a}))(\bar{x})||\leq \frac{m}{2\sqrt{n}}||\bar{x}||\]

para todo $\bar{x}\in \mathbb{R}^{n}$.

Usaremos en un momento estas desigualdades, pero por ahora fijemos nuestra atención en lo siguiente. Dados $\bar{u},\bar{v}\in B_{\delta}(\bar{a})$, tomemos el $k\in \{1,\dots ,n\}$ tal que $$||Df(\bar{a})(\bar{u}-\bar{v})||_{\infty}=|\triangledown f_{k}(\bar{a})\cdot (\bar{u}-\bar{v})|.$$

Para dicho $k$, tenemos

\begin{align*}
|\triangledown f_{k}(\bar{a})\cdot (\bar{u}- \bar{v})|&=||Df(\bar{a})(\bar{u}-\bar{v})||_{\infty}\\
&\geq \frac{1}{\sqrt{n}}||Df(\bar{a})(\bar{u}-\bar{v})||.
\end{align*}

¿Cómo podemos seguir con nuestras desigualdades? Necesitamos usar el teorema del valor medio. Bastará el que demostramos para campos escalares. Aplicándolo a $f_k$ en los puntos $\bar{u},\bar{v}$ cuyo segmento se queda en la bola convexa $B_\delta(\bar{a})$, podemos concluir que existe un vector $\bar{w}$ en el segmento $\bar{\bar{u}\bar{v}}$ que cumple

$$f_k(\bar{u})-f_k(\bar{v})=\triangledown f(\bar{w}) \cdot (\bar{u}-\bar{v}).$$

Sabemos que para cualquier vector el valor absoluto de cualquiera de sus coordenadas es en valor menor o igual que la norma del vector. Además, demostramos inicialmente unas desigualdades anteriores. Juntando esto, obtenemos la siguiente cadena de desigualdades:

\begin{align*}
||f(\bar{u})-f(\bar{v})||&\geq |f_{k}(\bar{u})-f_{k}(\bar{v})|\\
&=|\triangledown f(\bar{w}) \cdot (\bar{u}-\bar{v})|\\
&\geq |\triangledown f_k(\bar{a})\cdot (\bar{u}-\bar{v})|-|\triangledown f_k(\bar{w}) \cdot (\bar{u}-\bar{v})-\triangledown f_k(\bar{a})\cdot (\bar{u}-\bar{v})|\\
&\geq \frac{1}{\sqrt{n}}||Df(\bar{a})(\bar{u}-\bar{v})|| – ||Df(\bar{w})(\bar{u}-\bar{v})-Df(\bar{a})(\bar{u}-\bar{v})||\\
&\geq \frac{1}{\sqrt{n}}(m||\bar{u}-\bar{v}||)-\frac{m}{2\sqrt{n}}||\bar{u}-\bar{v}||\\
&=\frac{m}{2\sqrt{n}}||\bar{u}-\bar{v}||\\
&=\varepsilon||\bar{u}-\bar{v}||.
\end{align*}

La gran conclusión de esta cadena de desigualdades es que $$||f(\bar{u})-f(\bar{v})||\geq \varepsilon||\bar{u}-\bar{v}||,$$ que es lo que buscábamos.

$\square$

¡Esto es justo lo que nos pide el primer punto! Hemos encontrado una bola alrededor de $\bar{a}$ dentro de la cual si $\bar{u}\neq \bar{v}$, entonces $||f(\bar{u})-f(\bar{v})||\geq \varepsilon ||\bar{u}-\bar{v}||>0$, de modo que $f(\bar{u})\neq f(\bar{v})$. ¡La función restringida en esta bola es invertible! En términos geométricos el último teorema nos dice lo siguiente: Si $f$ es diferenciable en un abierto $S$, y $Df(\bar{a})$ es invertible, entonces hay una vecindad alrededor de $\bar{a}$ en donde $f$ «no se pega», es decir $f$ es inyectiva.

Figura 1: Si la función no es inyectiva, lo que tenemos es que proyecta el rectángulo $\mathcal{R}$ en una superficie que pega los puntos $\bar{a}$ y $\bar{b}$. Arriba una función inyectiva y abajo una que no lo es.

Ya vimos cómo encontrar una bola $B_\delta(\bar{a})$ dentro de la cual $f$ es inyectiva. Si pensamos que el contradominio es exactamente $f(B_\delta(\bar{a}))$, entonces la función también es suprayectiva. Esto hace que sea biyectiva y por tanto que tenga inversa $f^{-1}$.

La función inversa es continua

Veamos ahora que la función inversa es continua. De hecho, mostraremos algo un poco más fuerte.

Teorema. Sea $f:S\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ de clase $C^{1}$ en el abierto $S$, y $\bar{a}\in S$. Si $Df(\bar{a})$ es invertible, entonces existe $\delta >0$ tal que $B_{\delta}(\bar{a})\subseteq S$, $f$ es inyectiva en $B_{\delta}(\bar{a})$ y además $f^{-1}:f(B_{\delta}(\bar{a}))\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ es uniformemente continua en su dominio.

Demostración. La primera parte y la existencia de $f^{-1}:f(B_\delta(a))\subseteq \mathbb{R}^n \to \mathbb{R}^n$ se debe a la discusión de la sección anterior. De hecho, lo que mostramos es que existe $\delta >0$ y $\varepsilon>0$ tal que $||f(\bar{v})-f(\bar{u})||\geq \varepsilon||\bar{v}-\bar{u}||$ para todo $\bar{u},\bar{v}\in B_{\delta}(\bar{a})$.

Supongamos que nos dan un $\varepsilon^\ast$. Tomemos $\delta^\ast=\varepsilon^\ast \varepsilon$. Tomemos $\bar{x},\bar{y}$ en $f(B_\delta(\bar{a}))$ tales que $||\bar{y}-\bar{x}||<\delta ^{\ast}$. Como $\bar{x}$ y $\bar{y}$ están en dicha bola, podemos escribirlos como $\bar{x}=f(\bar{u})$, $\bar{y}=f(\bar{v})$ con $\bar{u},\bar{v}\in B_{\delta}(\bar{a})$. Notemos entonces que

\begin{align*}
||f^{-1}(\bar{y})-f^{-1}(\bar{x})||&=||\bar{v}-\bar{u}||\\
&\leq \frac{1}{\varepsilon}||f(\bar{v})-f(\bar{u})||\\
&= \frac{1}{\varepsilon}||\bar{y}-\bar{x}||\\
&<\frac{\varepsilon^\ast\varepsilon}{\varepsilon}\\
&=\varepsilon^\ast.
\end{align*}

Tenemos entonces que $f^{-1}$ es uniformemente continua en $f(B_\delta(\bar{a}))$.

$\square$

Esto demuestra el punto $(2)$ de nuestro teorema. La prueba de que el conjunto $f(B_\delta(\bar{a}))$ es abierto no es para nada sencilla como parecería ser. Una demostración muy instructiva, al nivel de este curso, se puede encontrar en el libro Cálculo diferencial de varias variables del Dr. Javier Páez Cárdenas editado por la Facultad de Ciencias de la Universidad Nacional Autónoma de México (UNAM) en las páginas 474-476.

La función inversa es diferenciable

Resta hacer la demostración de $(4)$. En esta sección veremos que la inversa $f^{-1}$ es derivable y que la derivada es precisamente lo que propone el teorema. En la siguiente sección veremos que la inversa es $C^1$.

Tomemos un punto $\bar{x}_0=f(\bar{v}_0)\in f(B_{\delta}(\bar{a}))$. Mostraremos que, en efecto, $T=(Df(\bar{v}_0))^{-1}$ es la derivada de $f^{-1}$ en $\bar{x}_0$, lo cual haremos por definición verificando que

\[ \lim\limits_{\bar{x}\to \bar{x}_{0}}\frac{f^{-1}(\bar{x})-f^{-1}(\bar{x}_{0})-T(\bar{x}-\bar{x}_{0})}{||\bar{x}-\bar{x}_{0}||}=0.\]

Para ello, introducimos la siguiente función auxiliar $g:B_{\delta}(\bar{a})\subseteq \mathbb{R}^{n}\rightarrow \mathbb{R}^{n}$ dada por:

\[ g(\bar{v})=\left\{ \begin{matrix} \frac{\bar{v}-\bar{v}_{0}-T(f(\bar{v})-f(\bar{v}_{0}))}{||f(\bar{v})-f(\bar{v}_{0})||} & \bar{v}\neq \bar{v}_{0} \\ \bar{0} & \bar{v}=\bar{v}_{0}. \end{matrix} \right. \]

Esta función está bien definida, pues $f$ es inyectiva en la bola $B_{\delta}(\bar{a})$. La composición $g\circ f^{-1}$ también está bien definida en el abierto $f(B_{\delta}(\bar{a}))$ y

\[ (g\circ f^{-1})(\bar{x})=\left\{ \begin{matrix} \frac{f^{-1}(\bar{x})-f^{-1}(\bar{x}_{0})-T(\bar{x}-\bar{x}_{0})}{||\bar{x}-\bar{x}_{0}||} & \bar{x}\neq \bar{x}_{0} \\ \bar{0} & \bar{x}=\bar{x}_{0} \end{matrix} \right.\]

para todo $\bar{x}\in f(B_{\delta}(\bar{a}))$. Esto nos permite poner el límite buscado como el límite de una composición de la siguiente forma:

\[ \lim\limits_{\bar{x}\to \bar{x}_{0}}\frac{f^{-1}(\bar{x})-f^{-1}(\bar{x}_{0})-T(\bar{x}-\bar{x}_{0})}{||\bar{x}-\bar{x}_{0}||}=\lim\limits_{\bar{x}\to \bar{x}_{0}}(g\circ f^{-1})(\bar{x}) \]

Como $f^{-1}$ es continua en $\bar{x}_{0}$, basta demostrar que $g$ es continua en $\bar{v}_{0}=f^{-1}(\bar{x}_{0})$. Esto equivale a probar que

\[ \lim\limits_{\bar{v}\to \bar{v}_{0}}g(\bar{v})=\lim\limits_{\bar{v}\to \bar{v}_{0}}\frac{\bar{v}-\bar{v}_{0}-(Df(\bar{v}_{0}))^{-1}(f(\bar{v})-f(\bar{v}_{0})))}{||f(\bar{v})-f(\bar{v}_{0})||}=0.\]

Hay que demostrar este último límite. Reescribimos la expresión

$$\frac{\bar{v}-\bar{v}_{0}-(Df(\bar{v}_{0}))^{-1}(f(\bar{v})-f(\bar{v}_{0}))}{||f(\bar{v})-f(\bar{v}_{0})||}$$ como

$$\frac{(Df(\bar{v}_{0}))^{-1}[Df(\bar{v}_{0})(\bar{v}-\bar{v}_{0})-(f(\bar{v})-f(\bar{v}_{0}))]}{||f(\bar{v})-f(\bar{v}_{0})||},$$

y luego multiplicamos y dividimos por $||\bar{v}-\bar{v}_0||$ y reorganizamos para obtener

\[ -\frac{||\bar{v}-\bar{v}_{0}||}{||f(\bar{v})-f(\bar{v}_{0})||}(Df(\bar{v}_{0}))^{-1}\left( \frac{f(\bar{v})-f(\bar{v}_{0})-Df(\bar{v}_{0})(\bar{v}-\bar{v}_{0})}{||\bar{v}-\bar{v}_{0}||}\right).\]

Como $(Df(\bar{v}_{0}))^{-1}$ es continua (por ser lineal) y $f$ es diferenciable en $\bar{v}_{0}$, se tiene que

\begin{align*}
\lim\limits_{\bar{v}\to \bar{v}_{0}}(Df(\bar{v}_{0}))&^{-1}\left( \frac{f(\bar{v})-f(\bar{v}_{0})-Df(\bar{v}_{0})(\bar{v}-\bar{v}_{0})}{||\bar{v}-\bar{v}_{0}||}\right)\\
&=(Df(\bar{v}_{0}))^{-1}\left( \lim\limits_{\bar{v}\to \bar{v}_{0}}\frac{f(\bar{v})-f(\bar{v}_{0})-Df(\bar{v}_{0})(\bar{v}-\bar{v}_{0})}{||\bar{v}-\bar{v}_{0}||}\right)\\
&=(Df(\bar{v}_{0}))^{-1}(\bar{0})\\
&=\bar{0}.
\end{align*}

El factor que nos falta entender es $\frac{||\bar{v}-\bar{v}_{0}||}{||f(\bar{v})-f(\bar{v}_{0})||}$. Pero por la primera proposición de esta entrada, sabemos que existe una $\epsilon>0$ que acota este factor superiormente por $\frac{1}{\epsilon}$. De esta manera,

\[ \lim\limits_{\bar{v}\to \bar{v}_{0}}g(\bar{v})=\cancelto{acotado}{\lim\limits_{\bar{v}\to \bar{v}_{0}}\frac{-||\bar{v}-\bar{v}_{0}||}{||f(\bar{v})-f(\bar{v}_{0})||}}\cancelto{0}{(Df(\bar{v}_{0}))^{-1}\left( \frac{f(\bar{v})-f(\bar{v}_{0})-Df(\bar{v}_{0})(\bar{v}-\bar{v}_{0})}{||\bar{v}-\bar{v}_{0}||}\right)}=0.\]

Esto nos dice entonces que $g$ es continua en $\bar{v}_0$ y por lo tanto:

\begin{align*}
\lim\limits_{\bar{x}\to \bar{x}_{0}}(g\circ f^{-1})(\bar{x}) &= g\left(\lim_{\bar{x}\to \bar{x}_0} f^{-1}(\bar{x})\right)\\
&=g(f^{-1}(\bar{x}_0))\\
&=g(\bar{v}_0)\\
&=\bar{0}.
\end{align*}

Por lo tanto $f^{-1}$ es diferenciable en $\bar{x}_{0}$ mediante la derivada que propusimos, es decir,

\[ Df^{-1}(\bar{x}_{0})=Df^{-1}(f(\bar{v}_{0}))=(Df(\bar{v}_{0}))^{-1}=(Df(f^{-1}(\bar{x}_{0})))^{-1} \]

para todo $\bar{x}_0\in f(B_{\delta}(\bar{a}))$.

La función inversa es de clase $C^1$

Resta verificar que $f^{-1}$ es de clase $C^{1}$ en $f(B_{\delta}(\bar{a}))$. Lo haremos con la caracterización de la entrada anterior. Tomemos una $\mu>0$. Nos gustaría ver que si $\bar{x}$ y $\bar{x}_0$ están suficientemente cerca, entonces

$$||Df^{-1}(\bar{x})(\bar{z})-Df^{-1}(\bar{x}_{0})(\bar{z})||<\mu ||\bar{z}||$$

para toda $\bar{z} \in \mathbb{R}^n$.

Recordemos que por la entrada anterior hay una $m>0$ tal que para todo $\bar{z}$ en $\mathbb{R}^n$ se cumple

\begin{equation}
\label{eq:clasec1}
\frac{1}{m}||\bar{z}||=\frac{1}{m}|Df(\bar{v})((Df(\bar{v}))^{-1})(\bar{z})||\geq ||(Df(\bar{v}))^{-1}(\bar{z})||
\end{equation}

También notemos que, si $X,Y$ son matrices invertibles en $M_n(\mathbb{R})$, tenemos:

$$X^{-1}(Y-X)Y^{-1}=X^{-1}YY^{-1}-X^{-1}XY^{-1}=X^{-1}-Y^{-1}.$$

Tomando $X=Df(\bar{v})$ y $Y=Df(\bar{v}_0)$, aplicando la igualdad anterior en un punto $\bar{x}$ en $\mathbb{R}^n$, sacando normas y usando la desigualdad \eqref{eq:clasec1}, obtenemos:

\begin{align*}
||(X^{-1}-Y^{-1})(\bar{z})||&=||(X^{-1}(Y-X)Y^{-1})(\bar{z})||\\
&\leq \frac{1}{m} ||((Y-X)Y^{-1})(\bar{z})||\\
&=\frac{1}{m}||((Df(\bar{v}_0)-Df(\bar{v}))Df^{-1}(f(\bar{v}_0)))(\bar{z})||.
\end{align*}

Como $f$ es de clase $C^1$, por la entrada anterior podemos construir una $\delta^\ast$ tal que $B_{\delta^\ast}(\bar{v}_0)\subseteq B_\delta(\bar{a})$ y para la cual si $\bar{v}$ está en $B_{\delta^\ast}(\bar{v}_0)$, entonces:

\[ \begin{equation}||(Df(\bar{v}_{0})-Df(\bar{v}))(\bar{z})||\leq m^{2}\mu||\bar{z}||\end{equation}.\]

Para todo $\bar{x}\in \mathbb{R}^{n}$.

Finalmente, como $f^{-1}$ es continua en $f(B_{\delta}(\bar{a}))$, si $\bar{x}$ y $\bar{x}_0$ están suficientemente cerca, digamos $||\bar{x}-\bar{x}_0||<\nu$, entonces

\[ \begin{equation}||f^{-1}(\bar{x})-f^{-1}(\bar{x}_{0})||=||\bar{v}-\bar{v}_{0}||<\delta ^\ast.\end{equation}.\]

Usamos todo lo anterior para establecer la siguiente cadena de desigualdades cuando $||\bar{x}-\bar{x}_0||<\nu$:

\begin{align*}
||Df^{-1}(\bar{x})(\bar{z})-Df^{-1}(\bar{x}_{0})(\bar{z})||&=||Df^{-1}(f(\bar{v}))(\bar{z})-Df^{-1}(f(\bar{v}_{0}))(\bar{z})||\\
&\leq \frac{1}{m}||[Df(\bar{v}_{0})-Df(\bar{v})](Df^{-1}(f(\bar{v}_{0})))(\bar{z})||\\
&\leq \frac{1}{m}\left( m^{2}\mu ||Df^{-1}(f(\bar{v}_{0}))(\bar{z})||\right) \\
&=m\mu ||Df^{-1}(f(\bar{v}_{0}))(\bar{z})||\\
&\leq m\mu \left( \frac{1}{m}||\bar{z}||\right)\\
&=\mu||\bar{z}||.
\end{align*}

Esto implica que $f^{-1}$ es de clase $C^1$. Como tarea moral, revisa los detalles y di explícitamente qué resultado de la entrada anterior estamos usando.

$\square$

Ejemplo del teorema de la función inversa

Ejemplo. Consideremos $\xi :\mathbb{R}^{3}\rightarrow \mathbb{R}^{3}$ dada por $\xi (r,\theta, \phi)=(r\hspace{0.15cm}sen \phi \hspace{0.15cm}cos\theta ,r\hspace{0.15cm} sen \phi \hspace{0.15cm}sen\theta ,r\hspace{0.15cm}cos \phi)$. Se tiene que $\xi$ es diferenciable en todo su dominio pues cada una de sus derivadas parciales es continua. Esta es la función de cambio de coordenadas de esféricas a rectangulares o cartesianas. La matriz jacobiana está dada como sigue.

\[ D\xi (r,\theta ,\phi )=\begin{pmatrix} sen\phi \hspace{0.1cm}cos\theta & -r\hspace{0.1cm}sen\phi \hspace{0.1cm}sen\theta & r\hspace{0.1cm}cos\phi \hspace{0.1cm}cos\theta \\ sen\phi \hspace{0.1cm}sen\theta & r\hspace{0.1cm}sen\phi \hspace{0.1cm}cos\theta & r\hspace{0.1cm}cos\phi \hspace{0.1cm}sen\theta \\ cos\phi & 0 & -r\hspace{0.1cm}sen\phi \end{pmatrix}.\]

Luego $\det(D\xi (r,\theta ,\phi ))=-r^{2}\hspace{0.1cm}sen\phi$ entonces $D\xi$ es invertible cuando $r\neq 0$ y $\phi \neq k\pi$, $k\in \mathbb{Z}$. Su inversa es:

\[ (D\xi (r,\theta ,\phi ))^{-1}=\begin{pmatrix} sen\phi \hspace{0.1cm}cos\theta & sen\phi \hspace{0.1cm}sen\theta & cos\phi \\ -\frac{sen\theta}{r\hspace{.01cm}sen\phi} & \frac{cos\theta}{r\hspace{0.1cm}sen\phi} & 0 \\ \frac{1}{r}\hspace{0.1cm}cos\theta \hspace{0.1cm}cos\phi & \frac{1}{r}\hspace{0.1cm}cos\phi \hspace{0.1cm}sen\theta & -\frac{1}{r}\hspace{0.1cm}sen\phi \end{pmatrix}.\]

El teorema de la función inversa nos garantiza la existencia local de una función $\xi ^{-1}$. En este caso, sería la función de cambio de coordenadas rectangulares a esféricas. Si $f:S\subseteq \mathbb{R}^{3}\rightarrow \mathbb{R}$ es una función $C^{1}$ dada en coordenadas esféricas; podemos asumir que $f\circ \xi ^{-1}$ es la misma función pero en términos de coordenadas rectangulares.

$\triangle$

Más adelante…

¡Lo logramos! Hemos demostrado el teorema de la función inversa, uno de los resultados cruciales de nuestro curso. El siguiente tema es el teorema de la función implícita, que será otro de nuestros resultados principales. Uno podría pensar que nuevamente tendremos que hacer una demostración larga y detallada. Pero afortunadamente la demostración del teorema de la función implícita se apoya fuertemente en el teorema de la función inversa que ya demostramos. En la siguiente entrada enunciaremos y demostraremos nuestro nuevo resultado y una entrada más adelante veremos varios ejemplos para profundizar en su entendimiento.

Tarea moral

En el ejemplo que dimos, verifica que el determinante en efecto es $-r^2\sin\phi$. Verifica también que la inversa es la matriz dada.
Repasa cada una de las demostraciones de esta entrada y asegúrate de entender por qué se siguen cada una de las desigualdades. Explica en qué momentos estamos usando resultados de la entrada anterior.
Da la función inversa de la transformación de cambio de coordenadas polares a rectangulares $g(r,\theta)=(r\hspace{0.1cm}cos\theta , r\hspace{0.1cm}sen\theta )$.
Demuestra que para todo $\bar{x}\in \mathbb{R}^{n}$ se tiene $||\bar{x}||\leq \sqrt{n}||\bar{x}||_{\infty}.$
Verifica que en efecto $||\cdot||_{\infty}$ es una norma.

Entradas relacionadas

Ir a Cálculo Diferencial e Integral III
Entrada anterior del curso: Introducción al teorema de la función inversa
Entrada siguiente del curso: Teorema de la función implícita y demostración

Álgebra Superior I: Funciones invertibles

Por Guillermo Oswaldo Cota Martínez

Deja un comentario

Introducción

Anteriormente vimos el concepto de composición entre funciones, que nos permiten saltar entre varios conjuntos de manera sencilla, revisamos algunas de sus propiedades y dimos algunos ejemplos. Ahora nos toca profundizar un poco más en la composición de funciones analizando un caso particular de funciones: las invertibles. Que en términos simples nos permiten deshacer los efectos de las operaciones.

Revirtiendo las cosas.

Pensemos por un momento en un cubo rubik, hay distintas técnicas para armarlo, pero por ahora nos enfocaremos en sus movimientos. La forma en que se usa el cubo, es moviendo sus caras hasta que todas las caras tengan un solo color. Imagina que tienes un cubo en tus manos, si mueves la cara que está hasta arriba, tienes dos formas de hacerlo, girar en sentido de las manecillas del reloj y girar en sentido contrario a las manecillas del reloj. No pasa nada si no estás seguro de tu movimiento, pues siempre puedes deshacer un movimiento rotando la misma cara que volteaste en sentido contrario. Incluso si mueves varias caras, podrás regresar al estado original si recuerdas exactamente las caras que volteaste y la dirección, pues para deshacer los movimientos, tendrás que empezar por la última cara que volteaste y deberás girarla al sentido contrario al que le diste vuelta. Por ejemplo esta imagen indica dos movimientos a las caras y la forma de «deshacer» los movimientos.

En la imagen también marcamos los movimientos de mover las dos caras como $f$, por ahora imagínate que ese movimiento de girar las dos caras como lo muestra la imagen, se llama el movimiento $f$. Mientras que el movimiento de deshacerlas se llama $f^{-1}$. Entonces si realizamos primero el movimiento $f$, el movimiento $f^{-1}$ revierte lo que hizo la primera, volviendo al estado inicial. Así es como vamos a pensar en la reversibilidad de las funciones, una manera de «volver a armar» el cubo.

Funciones reversibles

Diremos que una función es reversible si existe una función $f^{-1}:Im(f) \rightarrow X$ tal que $f ^{-1}\circ f = Id$ donde $Id$ es la función i dentidad, es decir, es la única función que asigna a cada elemento a sí mismo, es decir $Id(x)=x$.

Algunas observaciones de las funciones invertibles. Sea $f:X \rightarrow Y$ una función invertible, entonces:

$f$ es inyectiva.

Demostración. Supongamos que no es inyectiva, entonces existen $x_1,x_2 \in X$ distintos tales que $f(x_1) = f(x_2)$. Como $f$ es invertible, entonces existe su función inversa $f^{-1}:Im(f) \rightarrow X$, en donde $$x_1 = f^{-1} \circ f(x_1) = f^{-1} \circ f(x_2) = x_2 $$ Siendo esta una contradicción, pues supusimos que eran distintos elementos. Así, la función es inyectiva.

$\square$

$f^{-1}$ es inyectiva.

Demostración. De manera similar a la demostración anterior, si $y_1,y_2 \in Dom(f^{-1})$ son tales que $f^{-1}(y_1) = f^{-1}(y_2)$, se tiene que al ser $f$ inyectiva, $$f(f^{-1}(y_1)) = f(f^{-1}(y_2)) \Rightarrow y_1=y_2$$ Llegando a que $f^{-1}$ es inyectiva.

$\square$

Así, te puedes dar una idea de lo que significan las funciones invertibles. Con estas proposiciones hemos probado además que la función $f^{-1}: Im(f) \rightarrow X$ es una biyección. ¿Te imaginas porqué? Pues resulta que la función $f^{-1}$ también es suprayectiva.

$f^{-1} \circ f = f \circ f^{-1}$

Demostración. Sabemos que $f^{-1} \circ f = Id$, entonces bastará demostrar que $f \circ f^{-1} = Id$. Para ello consideremos $y \in Dom(f^{-1})=Im(f) \subset Y$. Supongamos que $$f \circ f^{-1}(y)=w$$. Entonces $$f^{-1}(f \circ f^{-1}(y)) = f^{-1}(w). $$ Como la composición es asociativa, entonces: $$f^{-1}(f \circ f^{-1}(y)) = (f^{-1} \circ f) \circ f^{-1}(y) = f^{-1}(y) = f^{-1}(w)$$ Como $f^{-1}$ es inyectiva, entonces $y=w$.

$\square$

Sea $g:Im(f) \rightarrow Z$ una función invertible, entonces $(g \circ f)^{-1} = f^{-1} \circ g^{-1}$ .

Demostración. Basta notar que por la asociatividad de las funciones:

$$ \begin{align*}
(g \circ f) \circ (f^{-1} \circ g^{-1}) &= g \circ (f \circ (f^{-1} \circ g^{-1})\\
&= g \circ ((f \circ f^{-1}) \circ g^{-1})\\
&= g \circ (Id \circ g^{-1}) \\
&= g \circ g^{-1} = Id
\end{align*}$$

$\square$

Más adelante…

Habiendo pasado por las funciones, su composición, sus propiedades y la inversa, utilizaremos estas definiciones para hablar de el tamaño de los conjuntos. Pues esta definición de funciones nos ayudan a decir «Cuántos elementos tiene un conjunto».

Tarea moral

A continuación hay algunos ejercicios para que practiques los conceptos vistos en esta entrada. Te será de mucha utilidad intentarlos para entender más la teoría vista.

Demuestra que $f^{-1}$ es suprayectiva.
Demuestra que $Dom(f^{-1})=Im(f)$.
Demuestra que $(f \circ (g \circ h))^{-1} = h^{-1} \circ (g^{-1} \circ f^{-1})$.
Da una condición suficiente para que una función no sea invertible.

Entradas relacionadas

Ir a Álgebra Superior I
Entrada anterior del curso: Composición de funciones
Siguiente entrada del curso: Cardinalidad de conjuntos finitos

Agradecimientos

Trabajo realizado con el apoyo del Programa UNAM-DGAPA-PAPIME PE109323 «Hacia una modalidad a distancia de la Licenciatura en Matemáticas de la FC-UNAM – Etapa 3»

Álgebra Lineal I: Reducción gaussiana para determinar inversas de matrices

Por Ayax Calderón

Deja un comentario

Introducción

En entradas anteriores hablamos de las matrices en forma escalonada reducida y de cómo cualquier matriz puede ser llevada a esta forma usando el algoritmo de reducción gaussiana. Usamos esto para resolver sistemas de ecuaciones lineales arbitrarios, es decir, de la forma $AX=b$. en esta ocasión estudiaremos cómo ver si una matriz es invertible y cómo determinar inversas de matrices mediante el algoritmo de reducción gaussiana.

Inversas de matrices elementales

Recordemos que una matriz $A\in M_n(F)$ es invertible si existe una matriz $B$ tal que $AB=BA=I_n$. Dicha matriz $B$ es única, se conoce como la matriz inversa de $A$ y se denota por $A^{-1}$.

Es importante observar que las matrices elementales son invertibles, puesto que las operaciones elementales se pueden revertir (esto también nos dice que la inversa de una matriz elemental también es una matriz elemental). Por ejemplo, si la matriz $E$ se obtiene de $I_n$ intercambiando los renglones $i$ y $j$, entonces $E^{-1}$ se obtiene de $I_n$ haciendo la misma operación, por lo que $E^{-1}=E$. Por otro lado, si $E$ se obtiene de sumar $\lambda$ veces el renglón $j$ al renglón $i$ en $I_n$, entonces E^{-1} se obtiene de sumar $-\lambda$ veces el renglón $j$ al renglón $i$ en $I_n$. El argumento para reescalamientos queda como tarea moral.

Debido a su importancia, enunciaremos este resultado como una proposición.

Proposición. Las matrices elementales son invertibles y sus inversas también son matrices elementales. Como consecuencia, cualquier producto de matrices elementales es invertible.

Algunas equivalencias de matrices invertibles

Hasta el momento sólo tenemos la definición de matrices invertibles para verificar si una matriz es invertible o no. Esto es poco práctico, pues dada una matriz, tendríamos que sacar otra «de la nada».

El siguiente resultado empieza a decirnos cómo saber de manera práctica cuándo una matriz cuadrada es invertible. También habla de una propiedad importante que cumplen las matrices invertibles.

Teorema. Para una matriz $A\in M_n(F)$ las siguientes afirmaciones son equivalentes:
(a) $A$ es invertible.
(b) $A_{red}=I_n$.
(c) $A$ es producto de matrices elementales.

Demostración. Para empezar, notemos que el producto de matrices invertibles es invertible , pues cualquier matriz elemental es invertible y las matrices invertibles son estables bajo productos. Esto prueba que (c) implica (a).

Ahora, supongamos que (a) se satisface. Recordemos que para una matriz $A\in M_{m,n}(F)$ podemos encontrar una matriz $B\in M_m(F)$ que es producto de matrices elementales y tal que $A_{red}=BA$. Como $A$ es invertible (por hipótesis) y $B$ es invertible (por la proposición de la sección anterior), entonces $BA$ es invertible y por consiguiente $A_{red}$ también lo es. En particular, todos los renglones de $A_{red}$ son distintos de cero y por lo tanto $A_{red}$ tiene $n$ pivotes, uno en cada columna. Como $A_{red}$ está en forma escalonada reducida, necesariamente $A_{red}=I_n$. Esto prueba que (a) implica (b).

Finalmente, supongamos que $(b)$ se satisface. Entonces existe una matriz $B$, la cual es producto de matrices elementales y tal que $BA=I_n$. Por la proposición anterior $B$ es invertible y $B^{-1}$ es producto de matrices elementales. Como $BA=I_n$, tenemos que $A=B^{-1}BA=B^{-1}$ y así $A$ es producto de matrices elementales, de manera que (b) implica (c).

$\square$

Ya podemos responder de manera práctica la pregunta «¿$A$ es invertible?». Para ello, basta aplicarle reducción gaussiana a $A$. Por el teorema anterior, $A$ es invertible si y sólo si la forma escalonada reducida obtenida es $I_n$. Por supuesto, esto aún no nos dice exactamente quién es la inversa.

Invertibilidad y sistemas de ecuaciones

La siguiente proposición expresa las soluciones del sistema $AX=b$ cuando $A$ es una matriz cuadrada e invertible. Para facilitar las cosas hay que tener un algoritmo para encontrar la inversa de una matriz. Más adelante veremos uno de estos algoritmos basado en reducción gaussiana.

Proposición. Si $A\in M_n(F)$ es una matriz invertible, entonces para todo $b\in F^n$ el sistema $AX=b$ tiene una única solución, dada por $X=A^{-1}b$.

Demostración. Sea $X$ una solución del sistema. Multiplicando la igualdad $AX=b$ por la izquierda por $A^{-1}$ obtenemos $A^{-1}(AX)=A^{-1}b$. Como
\begin{align*}
A^{-1}(AX)=(A^{-1}A)X
=I_nX=X,
\end{align*}
concluimos que $X=A^{-1}b$, por lo tanto el sistema tiene a lo más una solución. Para ver que esta es en efecto una solución, calculamos
\begin{align*}
A(A^{-1}b)=(AA^{-1})b=I_nb=b.
\end{align*}

$\square$

A continuación presentamos un resultado más, que relaciona matrices invertibles con que sus sistemas lineales correspondientes tengan soluciones únicas.

Teorema. Sea $A\in M_n(F)$ una matriz. Las siguientes afirmaciones son equivalentes:
(a) $A$ es invertible.
(b) Para toda $b\in F^n$ el sistema $AX=b$ tiene una única solución $X\in F^n$.
(c) Para toda $b\in F^n$ el sistema $AX=b$ es consistente.

Demostración. Ya demostramos que (a) implica (b). Es claro que (b) implica (c) pues si el sistema tiene una única solución, en particular tiene una solución.

Así, supongamos que que (c) se satisface. Sea $A_{red}$ la forma escalonada reducida de $A$. Por una proposición ya antes mencionada en esta entrada sabemos que existe una matriz $B$ la cual es producto de matrices elementales (por lo tanto invertible) y tal que $A_{red}=BA$. Deducimos que el sistema $A_{red}X=Bb$ tiene al menos una solución para todo $b\in F^n$ (pues si $AX=b$, entonces $A_{red}X=BAX=Bb$).

Ahora, para cualquier $b’\in F^n$ podemos encontrar $b$ tal que $b’=Bb$, tomando $b=B^{-1}b’$. Aquí estamos usando que $B$ es invertible por ser producto de matrices elementales. Concluimos que el sistema $A_{red}X=b$ es consistente para cada $b\in F^n$, pero entonces cualquier renglón de $A_{red}$ debe ser distinto de cero (si la fila $i$ es cero, entonces escogiendo cada vector $b$ con la $i-$ésima coordenada igual a $1$ se obtiene un sistema inconsistente) y, como en la demostración del teorema anterior, se tiene que $A_{red}=I_n$. Usando el teorema anterior concluimos que $A$ es invertible.

$\square$

Hasta ahora, al tomar un matriz cuadrada $A$ y proponer una inversa $B$, la definición de invertibilidad nos exige mostrar ambas igualdades $AB=I_n$ y $BA=I_n$. Finalmente tenemos las herramientas necesarias para mostrar que basta mostrar una de estas igualdades para que ambas se cumplan.

Corolario. Sean $A,B\in M_n(F)$ matrices.
(a) Si $AB=I_n$, entonces $A$ es invertible y $B=A^{-1}$.
(b) Si $BA=I_n$, entonces $A$ es invertible y $B=A^{-1}$.

Demostración. (a) Para cada $b\in F^n$ el vector $X=Bb$ satisface
\begin{align*}
AX=A(Bb)
=(AB)b=b,
\end{align*}
por lo tanto el sistema $AX=b$ es consistente para cada $b\in M_n(F)$. Por el teorema anterior, $A$ es invertible. Multiplicando la igualdad $AB=I_n$ por la izquierda por $A^{-1}$ obtenemos $B=A^{-1}AB=A^{-1}$, y así $B=A^{-1}$.
(b) Por el inciso (a), sabemos que $B$ es invertible y $A=B^{-1}$, pero entonces $A$ es invertible y $A^{-1}=B$.

$\square$

Determinar inversas usando reducción gaussiana

El corolario anterior nos da una manera práctica de saber si una matriz es invertible y, en esos casos, determinar inversas de matrices. En efecto, $A$ es invertible si y sólo si podemos encontrar una matriz $X$ tal que $AX=I_n$ y de aquí $X=A^{-1}$.

La ecuación $AX=I_n$ es equivalente a los siguientes sistemas lineales:
\begin{align*}
AX_1=e_1, \hspace{2mm}, AX_2=e_2, \hspace{2mm} \dots , \hspace
{2mm} AX_n=e_n.
\end{align*}
donde $e_i$ es la $i-$ésima columna de $I_n$ y $X_i$ denota la $i-$ésima columna de $X$. Ya sabemos cómo resolver sistemas lineales usando reducción gaussiana. Esto nos da una manera práctica de calcular $X$: si al menos uno de estos sistemas es inconsistente, entonces $A$ no es invertible; si todos son consistentes, entonces las soluciones $X_1,\ldots,X_n$ son las columnas de la inversa.

En la práctica, uno puede evitar resolver $n$ sistemas lineales considerando el siguiente truco:

En lugar de tomar $n$ matrices aumentadas $[A| e_i]$ considera sólo la matriz aumentada $[A|I_n]$, en la cual agregamos la matriz $I_n$ a la derecha de $A$ (de manera que $[A|I_n]$ tiene $2n$ columnas). Finalmente sólo hay que encontrar la forma escalonada reducida $[A’|X]$ de la matriz de $n\times 2n \hspace{2mm} [A|I_n]$. Si $A’$ resulta ser distinto de $I_n$, entonces $A$ no es inverible. Si $A’=I_n$, entonces la inversa de $A$ es simplemente la matriz $X$.

Ejemplo de determinar inversas

Para ilustrar lo anterior resolveremos el siguiente ejemplo práctico.

Ejemplo. Calcula la inversa de la matriz
\begin{align*}
A= \begin{pmatrix}
1 & 5 & 1\\
2 & 11 & 5\\
9 & -3 & 0
\end{pmatrix}.
\end{align*}

Solución. Aplicamos reducción gaussiana a la matriz extendida
\begin{align*}
[A|I_3]= \begin{pmatrix}
1 & 5 & 1 & 1 & 0 &0\\
2 & 11 & 5 & 0 & 1 & 0\\
9 & -3 & 0 & 0 & 0 & 1
\end{pmatrix}
\end{align*}
\begin{align*}
R_2 -2R_1\begin{pmatrix}
1 & 5 & 1 & 1 & 0 &0\\
0 & 1 & 3 & -2 & 1 & 0\\
9 & -3 & 0 & 0 & 0 & 1
\end{pmatrix}
\end{align*}
\begin{align*}
R_3 -9R_1\begin{pmatrix}
1 & 5 & 1 & 1 & 0 &0\\
0 & 1 & 3 & -2 & 1 & 0\\
0 & -48 & -9 & -9 & 0 & 1
\end{pmatrix}
\end{align*}

\begin{align*}
R_1 -5R_2\begin{pmatrix}
1 & 0 & -14 & 11 & -5 &0\\
0 & 1 & 3 & -2 & 1 & 0\\
0 & -48 & -9 & -9 & 0 & 1
\end{pmatrix}
\end{align*}
\begin{align*}
R_3 +48R_2\begin{pmatrix}
1 & 0 & -14 & 11 & -5 &0\\
0 & 1 & 3 & -2 & 1 & 0\\
0 & 0 & 135 & -105 & 48 & 1
\end{pmatrix}
\end{align*}
\begin{align*}
\frac{1}{135}R_3\begin{pmatrix}
1 & 0 & -14 & 11 & -5 &0\\
0 & 1 & 3 & -2 & 1 & 0\\
0 & 0 & 1 & -\frac{7}{9} & \frac{16}{45} & \frac{1}{135}
\end{pmatrix}
\end{align*}
\begin{align*}
R_1+14R_3\begin{pmatrix}
1 & 0 & 0 & \frac{1}{9} & -\frac{1}{45} &\frac{14}{135}\\
0 & 1 & 3 & -2 & 1 & 0\\
0 & 0 & 1 & -\frac{7}{9} & \frac{16}{45} & \frac{1}{135}
\end{pmatrix}
\end{align*}
\begin{align*}
R_2-3R_3\begin{pmatrix}
1 & 0 & 0 & \frac{1}{9} & -\frac{1}{45} &\frac{14}{135}\\
0 & 1 & 0 & \frac{1}{3} & -\frac{1}{15} & -\frac{1}{45}\\
0 & 0 & 1 & -\frac{7}{9} & \frac{16}{45} & \frac{1}{135}
\end{pmatrix}
\end{align*}
De donde
\begin{align*}
A^{-1}=\begin{pmatrix}
\frac{1}{9} & -\frac{1}{45} &\frac{14}{135}\\
\frac{1}{3} & -\frac{1}{15} & -\frac{1}{45}\\
-\frac{7}{9} & \frac{16}{45} & \frac{1}{135}
\end{pmatrix}.
\end{align*}

$\triangle$

En el ejemplo anterior hicimos el algoritmo de reducción gaussiana «a mano», pero también pudimos haber usado una herramienta en línea, como la calculadora de forma escalonada reducida de eMathHelp.

Más adelante…

En esta entrada vimos cómo el algoritmo de reducción gaussiana nos permite saber si una matriz es invertible o no. También nos da una forma práctica de determinar inversas. Hay otras formas de hacer esto mediante determinantes. Sin embargo, el método que describimos es bastante rápido y flexible.

Ya que entendemos un poco mejor a las matrices invertibles, el siguiente paso es usarlas para desarrollar nuestra teoría de álgebra lineal. Las matrices invertibles se corresponden con transformaciones lineales que se llaman isomorfismos, las cuales detectan cuándo dos espacios vectoriales son «el mismo».

También más adelante refinaremos el concepto de ser invertible y no. Esta es una clasificación en sólo dos posibilidades. Cuando definamos y estudiamos el rango de matrices y transformaciones lineales tendremos una forma más precisa de decir «qué tanta información guarda una transformación».

Tarea moral

A continuación hay algunos ejercicios para que practiques los conceptos vistos en esta entrada. Te será de mucha utilidad intentarlos para entender más la teoría vista.

¿Cuál sería la operación elemental inversa a aplicar un reescalamiento por un factor $c\neq 0$ en el renglón de una matriz?
Encuentra la inversa de la matriz
\begin{align*}
\begin{pmatrix}
1 & 2 & 1\\
2 & 0 & 2\\
1 & 2 & 0
\end{pmatrix}.
\end{align*}
mediante reducción gaussiana.
Resuelve el sistema de ecuaciones
\begin{align*}
\begin{cases}
x+2y+2z=1\\
2x+y+2z=4\\
2x+2y+z=5
\end{cases}
\end{align*}
Sea $A\in M_n(F)$ una matriz tal que $A_{red}\neq I_n$. Explica por qué $A$ no es invertible.
Cuando $A$ no es invertible, la matriz $[A|I_n]$ tiene forma escalonada reducida $[A_{red}|X]$, con $A_{red}\neq I_n$. ¿Qué sucede si en este caso haces la multiplicación $AX$? ¿Y la multiplicación $XA$?
Demuestra la primera proposición de esta entrada para operaciones elementales sobre las columnas.

Entradas relacionadas

Ir a Álgebra Lineal I
Entrada anterior del curso: Sistemas de ecuaciones lineales $AX=b$
Siguiente entrada del curso: Problemas de sistemas de ecuaciones e inversas de matrices

Agradecimientos

Trabajo realizado con el apoyo del Programa UNAM-DGAPA-PAPIME PE104721 «Hacia una modalidad a distancia de la Licenciatura en Matemáticas de la FC-UNAM»